Claude Fable 5 превзошел GPT-5.6 в тесте по переписыванию кода
Модель Claude Fable 5 от Anthropic показала троекратное превосходство над GPT-5.6 Sol от OpenAI в бенчмарке MirrorCode, предназначенном для оценки способности искусственного интеллекта переписывать программы с нуля.
Исследовательская группа Epoch AI обновила лидерборд своего бенчмарка MirrorCode, представив результаты новейших флагманских моделей от Anthropic и OpenAI. Согласно опубликованным данным, Claude Fable 5 успешно решил 64% задач, тогда как GPT-5.6 Sol справился только с 20%. Это значительный разрыв в производительности, который удивил экспертов.
Необычность результатов заключается в том, что на многих других бенчмарках эти две модели показывают схожие результаты, а кое-где GPT-5.6 даже опережает конкурента. При этом ни Epoch AI, ни Anthropic не предоставили официального объяснения столь заметной разницы. Специалисты предполагают, что причину аномалии можно будет установить после детального анализа данных самого лидерборда.


Комментарии (0)
Без регистрации. Комментарии проверяются автоматически перед публикацией.
Пока нет комментариев. Будьте первым!