Подписаться
Искусственный Интеллект

Разработчик создал тест, как чат-боты AI реагируют на спорные темы

214

Разработчик под псевдонимом создал то, что он называет «оценкой свободы слова», SpeechMap, для моделей ИИ, на которых работают чат-боты, такие как ChatGPT от OpenAI и Grok от X. Цель состоит в том, чтобы сравнить, как разные модели относятся к деликатным и спорным темам, сказал разработчик TechCrunch, включая политическую критику и вопросы о гражданских правах и протестах.

Компании, занимающиеся разработкой искусственного интеллекта, сосредоточились на тонкой настройке того, как их модели обрабатывают определенные темы, поскольку некоторые союзники Белого дома обвиняют популярные чат-боты в излишней «бодрости». Многие из приближенных президента Дональда Трампа, такие как Илон Маск и «царь» криптовалют и искусственного интеллекта Дэвид Сакс, утверждают, что чат-боты цензурируют консервативные взгляды.

Хотя ни одна из этих компаний ИИ не ответила на обвинения напрямую, некоторые из них пообещали скорректировать свои модели так, чтобы они реже отказывались отвечать на спорные вопросы. Например, для своего последнего урожая моделей Llama Meta заявила, что настроила модели так, чтобы они не поддерживали «одни взгляды в ущерб другим», а отвечали на более «обсуждаемые» политические подсказки.

Разработчик SpeechMap, известный в X под ником «xlr8harder», сказал, что его цель — помочь в обсуждении того, что должны и чего не должны делать модели.

«Я думаю, что такие обсуждения должны происходить публично, а не только в корпоративных штаб-квартирах», — сказал xlr8harder TechCrunch по электронной почте. «Вот почему я создал сайт, чтобы позволить каждому самостоятельно исследовать данные».

SpeechMap использует модели ИИ для оценки того, соответствуют ли другие модели заданному набору тестовых подсказок. Подсказки затрагивают ряд тем, от политики до исторических повествований и национальных символов. SpeechMap записывает, удовлетворяют ли модели «полностью» запрос (т. е. отвечают на него без уклончивости), дают ли «уклончивые» ответы или прямо отказываются отвечать.

Xlr8harder признает, что тест имеет недостатки, такие как «шум» из-за ошибок поставщика модели. Также возможно, что модели «судьи» содержат предубеждения, которые могут повлиять на результаты.

Но если предположить, что проект был создан добросовестно и данные точны, SpeechMap выявляет некоторые интересные тенденции.

Например, модели OpenAI со временем все чаще отказываются отвечать на подсказки, связанные с политикой, согласно SpeechMap. Последние модели компании, семейство GPT-4.1, немного более терпимы, но они все еще на шаг ниже, чем один из релизов OpenAI в прошлом году.

В феврале компания OpenAI заявила, что настроит будущие модели так, чтобы они не занимали редакционную позицию и предлагали несколько точек зрения на спорные темы — все это для того, чтобы сделать свои модели более «нейтральными».

Самая либеральная модель из всех — Grok 3, разработанная стартапом Илона Маска xAI, согласно бенчмаркингу SpeechMap. Grok 3 поддерживает ряд функций X, включая чат-бота Grok.

Grok 3 отвечает на 96,2% тестовых подсказок SpeechMap по сравнению со средним мировым «показателем соответствия» в 71,3%.

«В то время как последние модели OpenAI со временем стали менее либеральными, особенно в политически деликатных вопросах, xAI движется в противоположном направлении», — сказал xlr8harder.

Когда Маск анонсировал Grok примерно два года назад, он представил модель ИИ как резкую, неотфильтрованную и анти-«пробужденную» — в общем, готовую отвечать на спорные вопросы, на которые другие системы ИИ не будут отвечать. Он выполнил часть этого обещания. Например, если Grok и Grok 2 скажут быть вульгарными, они с радостью подчинятся, изрыгая красочные выражения, которые вы, вероятно, не услышите от ChatGPT.

Но модели Grok до Grok 3 были застрахованы от политических тем и не переходили определенных границ. Фактически, одно исследование показало, что Grok склонялся к политическим левым взглядам на такие темы, как права трансгендеров, программы разнообразия и неравенство.

Маск обвинил в таком поведении данные обучения Grok — публичные веб-страницы — и пообещал «сделать Grok ближе к политически нейтральному». Если бы не громкие ошибки вроде кратковременной цензуры нелестных упоминаний президента Дональда Трампа и Маска, похоже, он бы достиг этой цели.

Источник