Подписаться
Искусственный Интеллект

Старшеклассник создал сайт, который позволяет бросить вызов ИИ в Minecraft

215

Поскольку традиционные методы сравнительного анализа ИИ оказываются неэффективными, разработчики ИИ обращаются к более креативным способам оценки возможностей генеративных моделей ИИ. Для одной группы разработчиков это Minecraft, принадлежащая Microsoft игра-песочница для строительства.

Веб-сайт Minecraft Benchmark (или MC-Bench) был разработан совместно, чтобы сталкивать модели ИИ друг с другом в испытаниях лицом к лицу, чтобы отвечать на подсказки с помощью творений Minecraft. Пользователи могут голосовать за то, какая модель справилась лучше, и только после голосования они могут увидеть, какой ИИ создал каждую сборку Minecraft.

Для Ади Сингха, ученика 12-го класса, основавшего MC-Bench, ценность Minecraft заключается не столько в самой игре, сколько в том, насколько она знакома людям — в конце концов, это самая продаваемая видеоигра всех времен. Даже для тех, кто не играл в игру, все равно возможно оценить, какое блочное представление ананаса реализовано лучше.

«Minecraft позволяет людям гораздо легче увидеть прогресс [разработки ИИ], — сказал Сингх TechCrunch. — Люди привыкли к Minecraft, привыкли к его внешнему виду и атмосфере».

В настоящее время MC-Bench насчитывает восемь человек в качестве добровольных участников. Anthropic, Google, OpenAI и Alibaba субсидировали использование своих продуктов для запуска подсказок бенчмарков, согласно веб-сайту MC-Bench, но компании не связаны иным образом.

«В настоящее время мы просто делаем простые сборки, чтобы оценить, насколько мы продвинулись от эпохи GPT-3, но [мы] могли бы увидеть, как мы масштабируемся до этих более длинных планов и целевых задач», — сказал Сингх. «Игры могут быть просто средством для проверки агентного мышления, которое безопаснее, чем в реальной жизни, и более контролируемо для целей тестирования, что делает его более идеальным в моих глазах».

Другие игры, такие как Pokémon Red, Street Fighter и Pictionary, использовались в качестве экспериментальных тестов для ИИ, отчасти потому, что искусство тестирования ИИ — крайне сложная задача.

Исследователи часто тестируют модели ИИ на стандартизированных оценках, но многие из этих тестов дают ИИ преимущество на домашней площадке. Из-за того, как они обучены, модели от природы одарены в определенных, узких видах решения проблем, особенно в решении проблем, требующих механического запоминания или базовой экстраполяции.

Проще говоря, сложно понять, что означает, что GPT-4 от OpenAI может набрать 88-й процентиль на тесте LSAT, но не может различить, сколько букв R в слове «клубника». Claude 3.7 Sonnet от Anthropic достиг точности 62,3% на стандартизированном тесте разработки программного обеспечения, но играет в покемонов хуже, чем большинство пятилетних детей.

Технически MC-Bench — это тест программирования, поскольку модели должны написать код для создания заданной сборки, например, «Снеговик Фрости» или «Очаровательная тропическая пляжная хижина на нетронутом песчаном берегу».

Но большинству пользователей MC-Bench проще оценить, выглядит ли снеговик лучше, чем копаться в коде, что делает проект более привлекательным — и, следовательно, дает возможность собрать больше данных о том, какие модели стабильно показывают лучшие результаты.

Конечно, вопрос о том, насколько эти оценки важны для оценки полезности ИИ, остается спорным. Сингх утверждает, что это сильный сигнал.

«Текущий рейтинг лидеров довольно точно отражает мой собственный опыт использования этих моделей, что отличается от многих чисто текстовых бенчмарков», — сказал Сингх. «Возможно, [MC-Bench] может быть полезен компаниям, чтобы знать, движутся ли они в правильном направлении».

Источник