Подписаться
Искусственный Интеллект

Новый сложный тест AGI ставит в тупик большинство моделей ИИ

205

Фонд Arc Prize Foundation, некоммерческая организация, соучредителем которой является известный исследователь в области искусственного интеллекта Франсуа Шолле, в понедельник объявил в своем блоге о создании нового сложного теста для измерения общего интеллекта ведущих моделей искусственного интеллекта.

Пока что новый тест под названием ARC-AGI-2 поставил в тупик большинство моделей.

Модели ИИ «рассуждающего» типа, такие как o1-pro от OpenAI и R1 от DeepSeek, набирают от 1% до 1,3% на ARC-AGI-2, согласно таблице лидеров Arc Prize. Мощные модели без рассуждений, включая GPT-4.5, Claude 3.7 Sonnet и Gemini 2.0 Flash, набирают около 1%.

Тесты ARC-AGI состоят из головоломок, в которых ИИ должен идентифицировать визуальные шаблоны из набора разноцветных квадратов и генерировать правильную сетку «ответов». Задачи были разработаны, чтобы заставить ИИ адаптироваться к новым проблемам, с которыми он раньше не сталкивался.

Фонд Arc Prize Foundation провел тест ARC-AGI-2 среди более чем 400 человек, чтобы установить базовый уровень для человека. В среднем «группы» этих людей ответили правильно на 60% вопросов теста — намного лучше, чем результаты любой из моделей.

В посте на X Шолле заявил, что ARC-AGI-2 является лучшим показателем реального интеллекта модели ИИ, чем первая итерация теста, ARC-AGI-1. Тесты Arc Prize Foundation направлены на оценку того, может ли система ИИ эффективно приобретать новые навыки за пределами данных, на которых она была обучена.

Шолле сказал, что в отличие от ARC-AGI-1, новый тест не позволяет моделям ИИ полагаться на «грубую силу» — обширную вычислительную мощность — для поиска решений. Ранее Шолле признал, что это было серьезным недостатком ARC-AGI-1.

Для устранения недостатков первого теста ARC-AGI-2 вводит новую метрику: эффективность. Он также требует от моделей интерпретировать шаблоны на лету, а не полагаться на запоминание.

«Интеллект определяется не только способностью решать проблемы или достигать высоких результатов», — написал в своем блоге соучредитель Arc Prize Foundation Грег Камрадт. «Эффективность, с которой эти возможности приобретаются и развертываются, является важнейшим, определяющим компонентом. Основной вопрос, который задается, заключается не только в том, «Может ли ИИ приобрести [этот] навык для решения задачи?», но и в том, «С какой эффективностью или затратами?»»

ARC-AGI-1 оставался непобедимым примерно пять лет до декабря 2024 года, когда OpenAI выпустила свою усовершенствованную модель рассуждений o3, которая превзошла все другие модели ИИ и сравнялась с человеческими показателями при оценке. Однако, как мы отметили в то время, прирост производительности o3 на ARC-AGI-1 имел высокую цену.

Версия модели OpenAI o3 — o3 (low) — первой достигшая новых высот на ARC-AGI-1, набрав 75,7% в тесте, получила жалкие 4% на ARC-AGI-2, используя вычислительную мощность стоимостью 200 долларов на задачу.

Появление ARC-AGI-2 произошло в то время, когда многие в технологической отрасли призывают к новым, ненасыщенным тестам для измерения прогресса ИИ. Соучредитель Hugging Face Томас Вольф недавно сказал TechCrunch, что в индустрии ИИ не хватает тестов для измерения ключевых черт общего искусственного интеллекта, включая креативность.

Наряду с новым бенчмарком фонд Arc Prize Foundation объявил о новом конкурсе Arc Prize 2025, предлагающем разработчикам достичь точности 85% в тесте ARC-AGI-2, потратив всего 0,42 доллара США за задачу.

Источник