Подписаться
Искусственный Интеллект

Исследователи утверждают, что открыли новый метод «масштабирования» ИИ

259

Исследователи обнаружили новый «закон масштабирования» ИИ? Это то, о чем говорят некоторые в социальных сетях, но эксперты настроены скептически.

Законы масштабирования ИИ, немного неформальная концепция, описывают, как производительность моделей ИИ улучшается по мере увеличения размера наборов данных и вычислительных ресурсов, используемых для их обучения. Примерно до недавнего времени масштабирование «предобучения» — обучение все более крупных моделей на все более крупных наборах данных — было доминирующим законом, по крайней мере в том смысле, что большинство передовых лабораторий ИИ приняли его.

Предварительное обучение не исчезло, но появились два дополнительных закона масштабирования, масштабирование после обучения и масштабирование во время тестирования, чтобы дополнить его. Масштабирование после обучения по сути является настройкой поведения модели, в то время как масштабирование во время тестирования подразумевает применение большего количества вычислений для вывода — т. е. запуска моделей — для управления формой «рассуждения» (см.: модели типа R1).

Недавно исследователи из Google и Калифорнийского университета в Беркли в своей статье предложили то, что некоторые интернет-комментаторы назвали четвертым законом: «поиск во время вывода».

Поиск во время вывода заставляет модель параллельно генерировать множество возможных ответов на запрос, а затем выбирать «лучший» из них. Исследователи утверждают, что это может повысить производительность годовалой модели, например, Gemini 1.5 Pro от Google, до уровня, который превосходит модель «рассуждения» o1-preview от OpenAI в научных и математических тестах.

«[Б]лагодаря простому случайному отбору 200 ответов и самопроверке Gemini 1.5 — древняя модель начала 2024 года — превосходит o1-preview и приближается к o1», — написал Эрик Чжао, докторант Google и один из соавторов статьи, в серии постов на X. «Волшебство в том, что самопроверка естественным образом становится проще при масштабировании! Можно было бы ожидать, что выбор правильного решения становится сложнее, чем больше ваш пул решений, но на самом деле все наоборот!»

Однако некоторые эксперты утверждают, что результаты не являются неожиданными и что поиск на этапе вывода может оказаться бесполезным во многих сценариях.

Мэтью Гуздиал, исследователь ИИ и доцент Университета Альберты, рассказал TechCrunch, что этот подход работает лучше всего, когда есть хорошая «функция оценки» — другими словами, когда можно легко определить лучший ответ на вопрос. Но большинство запросов не настолько однозначны.

«[I]сли мы не можем написать код, чтобы определить, что мы хотим, мы не можем использовать поиск [во время вывода]», — сказал он. «Для чего-то вроде общего языкового взаимодействия мы не можем этого сделать […] Это, как правило, не лучший подход к фактическому решению большинства проблем».

Эрик Чжао, исследователь Google и один из соавторов исследования, слегка возразил против утверждений Гуздиала.

«[O]наша статья на самом деле фокусируется на случаях, когда у вас нет доступа к «функции оценки» или «коду для определения того, что мы хотим», который мы обычно называем верификатором истинности», — сказал он. «Вместо этого мы изучаем, когда оценка — это то, что [модель] должна выяснить, пытаясь проверить себя. На самом деле, главный момент нашей статьи заключается в том, что разрыв между этим режимом и режимом, где у вас есть верификаторы истинности […], может прекрасно сокращаться с масштабированием».

Однако Майк Кук, научный сотрудник Королевского колледжа Лондона, специализирующийся на ИИ, согласился с оценкой Гуздиала, добавив, что она подчеркивает разницу между «рассуждением» в понимании ИИ и процессами человеческого мышления.

«[Поиск во время вывода] не «повышает процесс рассуждения» модели», — сказал Кук. «[Э]то просто способ обойти ограничения технологии, склонной совершать очень уверенно поддерживаемые ошибки […] Интуитивно понятно, что если ваша модель совершает ошибку в 5% случаев, то проверка 200 попыток решения одной и той же проблемы должна облегчить обнаружение этих ошибок».

То, что поиск во время вывода может иметь ограничения, наверняка станет неприятной новостью для отрасли ИИ, которая стремится масштабировать модель «рассуждения» с вычислительной эффективностью. Как отмечают соавторы статьи, сегодня модели рассуждений могут выложить тысячи долларов вычислений на одну математическую задачу.

Похоже, поиск новых методов масштабирования будет продолжен.

Обновлено 20.03 в 5:12 по тихоокеанскому времени: добавлены комментарии соавтора исследования Эрика Чжао, который не согласен с оценкой независимого исследователя, критиковавшего работу.

Источник