<meta name="robots" content="index, follow, max-snippet:-1, max-image-preview:large, max-video-preview:-1">

Бенчмарки ИИ: почему одной цифре нельзя верить

9 подписчиков

12+
12+

4 часа назад

ПожаловатьсяНарушение авторских прав

9 подписчиков

12+
12+

4 часа назад

ПожаловатьсяНарушение авторских прав
12+
12+

4 часа назад

Каждый релиз модели сопровождают рекорды: MMLU, GPQA, SWE-bench, Humanity's Last Exam и место на Арене. Но один процент ничего не говорит без версии теста, агентной обвязки, числа попыток, вычислительного бюджета и способа оценки. В этом выпуске разбираем, что на самом деле измеряют главные бенчмарки ИИ. Почему старые экзамены насыщаются и попадают в обучающие данные. Зачем появились MMLU-Pro, HLE-Rolling, LiveBench и LiveCodeBench. Почему исходные 1,96% на SWE-bench нельзя напрямую сравнивать с современными результатами выше 70%. Как pass@1 превращается в pass@100, почему модель-судья тоже ошибается и что произошло с экспериментальной версией Llama 4 на LMArena. Отдельно разбираем FrontierMath, ARC-AGI-2, GDPval и временной горизонт METR. В финале — девять вопросов к любому лидерборду и простой способ собрать собственный тест под реальную работу. 00:00 Почему одна цифра ничего не доказывает 01:48 Из чего состоит бенчмарк 03:23 Карта главных тестов 06:55 Загрязнение данных 08:42 Насыщение и движущиеся тесты 10:15 Модель против всей системы 12:16 Ловушки метрик и ИИ-судьи 14:52 Игра на лидерборд 17:06 Реальные рабочие тесты 18:31 Девять вопросов к любому рекорду 21:21 Финал серии #бенчмарки #нейросети #ИИ #LLM #SWEbench #MMLU #LMArena #фактчек

Название:

Бенчмарки ИИ: почему одной цифре нельзя верить

Категория:

Разное