Разработан собственный бенчмарк для выбора LLM в корпоративных задачах
Команда из Habr успешно разработала и применила собственный бенчмарк для сравнения крупномасштабных языковых моделей (LLM) DeepSeek, ChatGPT и Claude, чтобы выбрать наиболее подходящую для задач внутренних ИИ-ассистентов.
Обычно выбор LLM для корпоративных решений основывается на публичных рейтингах, которые не всегда отражают специфику конкретных задач и экономическую эффективность. В ответ на это, специалисты создали уникальную систему оценки, позволяющую протестировать модели на 24 вопросах, связанных с их внутренней электронной лабораторной базой данных.
Тестирование проводилось в условиях реальной работы с электронным лабораторным журналом, где ИИ-ассистент должен отвечать на вопросы, используя данные экспериментов и измерений. Этот подход обеспечил максимальную релевантность результатов для их специфических потребностей, давая более точное представление о возможностях каждой модели в сравнении с общими бенчмарками.


Комментарии (0)
Без регистрации. Комментарии проверяются автоматически перед публикацией.
Пока нет комментариев. Будьте первым!