Подписаться
Искусственный Интеллект

Модель искусственного интеллекта o3 от OpenAI показала более низкие результаты

210

Расхождение между результатами собственных и сторонних тестов для модели искусственного интеллекта o3 компании OpenAI поднимает вопросы относительно прозрачности компании и ее практики тестирования моделей.

Когда OpenAI представила o3 в декабре, компания заявила, что модель может ответить чуть более чем на четверть вопросов на FrontierMath, сложном наборе математических задач. Этот результат сразил конкурентов — следующая лучшая модель смогла ответить только на около 2% задач FrontierMath правильно.

«Сегодня все предложения имеют менее 2% [на FrontierMath]», — сказал Марк Чен, главный научный сотрудник OpenAI, во время прямой трансляции. «Мы видим [внутренне], что с o3 в агрессивных тестовых вычислительных настройках мы можем получить более 25%».

Как оказалось, эта цифра, скорее всего, была верхней границей, достигнутой версией o3 с большим объемом вычислений, чем модель OpenAI, публично представленная на прошлой неделе.

Epoch AI, исследовательский институт, стоящий за FrontierMath, опубликовал результаты своих независимых бенчмарк-тестов o3 в пятницу. Epoch обнаружил, что o3 набрал около 10%, что значительно ниже наивысшего заявленного балла OpenAI.

Это не означает, что OpenAI солгала, по сути. Результаты бенчмарка, опубликованные компанией в декабре, показывают нижнюю границу оценки, которая совпадает с оценкой, полученной Epoch. Epoch также отметила, что ее тестовая установка, вероятно, отличается от OpenAI, и что она использовала обновленную версию FrontierMath для своих оценок.

«Разница между нашими результатами и результатами OpenAI может быть связана с тем, что OpenAI оценивает результаты с помощью более мощной внутренней базы данных, используя больше времени на тестирование [вычислений], или с тем, что эти результаты были получены на другом подмножестве FrontierMath (180 задач в frontiermath-2024-11-26 против 290 задач в frontiermath-2025-02-28-private)», — пишет Epoch.

Согласно сообщению на X от ARC Prize Foundation, организации, которая тестировала предварительную версию o3, публичная модель o3 «является другой моделью […], настроенной для использования в чате/продукте», что подтверждает отчет Epoch.

«Все выпущенные вычислительные уровни o3 меньше версии, которую мы [тестировали]», — написал ARC Prize. В целом можно ожидать, что более крупные вычислительные уровни покажут лучшие результаты тестов.

Венда Чжоу из OpenAI, член технического персонала, сказал во время трансляции на прошлой неделе, что o3 в производстве «более оптимизирован для реальных случаев использования» и скорости по сравнению с версией o3, продемонстрированной в декабре. В результате он может демонстрировать «несоответствия» эталонных показателей, добавил он.

«[М]ы провели [оптимизации], чтобы сделать [модель] более рентабельной [и] более полезной в целом», — сказал Чжоу. «Мы все еще надеемся, что — мы все еще думаем, что — это гораздо лучшая модель […] Вам не придется так долго ждать, когда вы запрашиваете ответ, что является реальной вещью с этими [типами] моделей».

Конечно, тот факт, что публичный релиз o3 не соответствует обещаниям OpenAI, полученным в ходе тестирования, является несколько спорным вопросом, поскольку модели o3-mini-high и o4-mini компании превосходят o3 на FrontierMath, а OpenAI планирует в ближайшие недели представить более мощную версию o3, o3-pro.

Однако это еще одно напоминание о том, что результаты тестов ИИ не стоит принимать за чистую монету, особенно если источником является компания, предлагающая услуги на продажу.

«Споры» относительно сравнительного анализа становятся обычным явлением в отрасли искусственного интеллекта, поскольку поставщики стремятся попасть в заголовки и завоевать внимание общественности новыми моделями.

В январе Epoch подверглась критике за то, что ждала раскрытия финансирования от OpenAI, пока компания не объявила o3. Многие ученые, которые внесли свой вклад в FrontierMath, не были проинформированы об участии OpenAI, пока это не стало публичным.

Совсем недавно xAI Илона Маска обвинили в публикации вводящих в заблуждение таблиц с результатами тестов для его последней модели искусственного интеллекта Grok 3. Только в этом месяце Meta призналась в публикации результатов тестов для версии модели, которая отличалась от той, которую компания предоставила разработчикам.

Обновлено 16:21 по тихоокеанскому времени: добавлены комментарии от Венды Чжоу, члена технического персонала OpenAI, с прямой трансляции на прошлой неделе.