Новый сложный тест AGI ставит в тупик большинство моделей ИИ
Фонд Arc Prize Foundation, некоммерческая организация, соучредителем которой является известный исследователь в области искусственного интеллекта Франсуа Шолле, в понедельник объявил в своем блоге о создании нового сложного теста для измерения общего интеллекта ведущих моделей искусственного интеллекта.
Пока что новый тест под названием ARC-AGI-2 поставил в тупик большинство моделей.
Модели ИИ «рассуждающего» типа, такие как o1-pro от OpenAI и R1 от DeepSeek, набирают от 1% до 1,3% на ARC-AGI-2, согласно таблице лидеров Arc Prize. Мощные модели без рассуждений, включая GPT-4.5, Claude 3.7 Sonnet и Gemini 2.0 Flash, набирают около 1%.
Тесты ARC-AGI состоят из головоломок, в которых ИИ должен идентифицировать визуальные шаблоны из набора разноцветных квадратов и генерировать правильную сетку «ответов». Задачи были разработаны, чтобы заставить ИИ адаптироваться к новым проблемам, с которыми он раньше не сталкивался.
Фонд Arc Prize Foundation провел тест ARC-AGI-2 среди более чем 400 человек, чтобы установить базовый уровень для человека. В среднем «группы» этих людей ответили правильно на 60% вопросов теста — намного лучше, чем результаты любой из моделей.
В посте на X Шолле заявил, что ARC-AGI-2 является лучшим показателем реального интеллекта модели ИИ, чем первая итерация теста, ARC-AGI-1. Тесты Arc Prize Foundation направлены на оценку того, может ли система ИИ эффективно приобретать новые навыки за пределами данных, на которых она была обучена.
Шолле сказал, что в отличие от ARC-AGI-1, новый тест не позволяет моделям ИИ полагаться на «грубую силу» — обширную вычислительную мощность — для поиска решений. Ранее Шолле признал, что это было серьезным недостатком ARC-AGI-1.
Для устранения недостатков первого теста ARC-AGI-2 вводит новую метрику: эффективность. Он также требует от моделей интерпретировать шаблоны на лету, а не полагаться на запоминание.
«Интеллект определяется не только способностью решать проблемы или достигать высоких результатов», — написал в своем блоге соучредитель Arc Prize Foundation Грег Камрадт. «Эффективность, с которой эти возможности приобретаются и развертываются, является важнейшим, определяющим компонентом. Основной вопрос, который задается, заключается не только в том, «Может ли ИИ приобрести [этот] навык для решения задачи?», но и в том, «С какой эффективностью или затратами?»»
ARC-AGI-1 оставался непобедимым примерно пять лет до декабря 2024 года, когда OpenAI выпустила свою усовершенствованную модель рассуждений o3, которая превзошла все другие модели ИИ и сравнялась с человеческими показателями при оценке. Однако, как мы отметили в то время, прирост производительности o3 на ARC-AGI-1 имел высокую цену.
Версия модели OpenAI o3 — o3 (low) — первой достигшая новых высот на ARC-AGI-1, набрав 75,7% в тесте, получила жалкие 4% на ARC-AGI-2, используя вычислительную мощность стоимостью 200 долларов на задачу.
Появление ARC-AGI-2 произошло в то время, когда многие в технологической отрасли призывают к новым, ненасыщенным тестам для измерения прогресса ИИ. Соучредитель Hugging Face Томас Вольф недавно сказал TechCrunch, что в индустрии ИИ не хватает тестов для измерения ключевых черт общего искусственного интеллекта, включая креативность.
Наряду с новым бенчмарком фонд Arc Prize Foundation объявил о новом конкурсе Arc Prize 2025, предлагающем разработчикам достичь точности 85% в тесте ARC-AGI-2, потратив всего 0,42 доллара США за задачу.