Шесть ИИ-судей имеют вес двух независимых голосов
Исследование показало, что шесть различных больших языковых моделей (LLM), используемых в качестве судей, фактически обеспечивают лишь 1,9 независимых голоса, несмотря на то, что они разработаны в четырёх разных лабораториях и используют различные архитектуры.
При оценке контента с помощью нескольких LLM-судей, которые голосуют за тот или иной вердикт, существует распространённое предположение о независимости их оценок. Обычно считается, что использование различных моделей от разных разработчиков снижает корреляцию ошибок и обеспечивает более надёжный результат. Однако новое исследование ставит это под сомнение.
Проведённый анализ выявил высокую корреляцию между ошибками, допускаемыми этими LLM. Это означает, что, хотя моделей шесть, их коллективное мнение не так разнообразно, как может показаться. Фактически, их совокупная независимость эквивалентна мнению всего двух экспертов.


Комментарии (0)
Без регистрации. Комментарии проверяются автоматически перед публикацией.
Пока нет комментариев. Будьте первым!