Подписаться
Искусственный Интеллект

OpenAI объясняет, почему ChatGPT стал слишком льстивым

282

Компания OpenAI опубликовала отчет о недавних проблемах с подхалимством в стандартной модели искусственного интеллекта, лежащей в основе ChatGPT, GPT-4o, — проблемах, которые заставили компанию откатить обновление модели, выпущенное на прошлой неделе.

На выходных, после обновления модели GPT-4o, пользователи социальных сетей отметили, что ChatGPT начал реагировать в чрезмерно валидирующей и приемлемой манере. Это быстро стало мемом. Пользователи выкладывали скриншоты ChatGPT, приветствующие всевозможные проблемные, опасные решения и идеи.

В сообщении на X в воскресенье генеральный директор Сэм Альтман признал наличие проблемы и сказал, что OpenAI будет работать над исправлениями «как можно скорее». Два дня спустя Альтман объявил, что обновление GPT-4o откатывается и что OpenAI работает над «дополнительными исправлениями» индивидуальности модели.

По данным OpenAI, обновление, призванное сделать стандартную индивидуальность модели «более интуитивно понятной и эффективной», было слишком основано на «краткосрочной обратной связи» и «не в полной мере учитывало, как взаимодействие пользователей с ChatGPT меняется с течением времени».

Мы откатили обновление GPT-4o прошлой недели в ChatGPT, потому что оно было слишком лестным и приятным. Теперь у вас есть доступ к более ранней версии с более сбалансированным поведением.

Подробнее о том, что произошло, почему это важно и как мы боремся с подхалимством: https://t.co/LOhOU7i7DC

— OpenAI (@OpenAI) 30 апреля 2025 г.

«В результате GPT-4o перекосился в сторону ответов, которые были чрезмерно поддерживающими, но неискренними», — написал OpenAI в своем сообщении в блоге. «Льстивое взаимодействие может быть неудобным, тревожным и вызывать стресс. Мы не оправдали ожиданий и работаем над тем, чтобы исправить это».

OpenAI заявляет, что внедряет несколько исправлений, включая совершенствование основных методов обучения моделей и системных подсказок, чтобы явно увести GPT-4o от подхалимства. (Системные подсказки — это начальные инструкции, которые направляют общее поведение модели и тон во взаимодействиях.) Компания также создает больше защитных ограждений, чтобы «повысить честность и прозрачность [модели]», и продолжает расширять свои оценки, чтобы «помочь выявить проблемы, выходящие за рамки подхалимства», — говорится в ней.

OpenAI также заявляет, что экспериментирует со способами, позволяющими пользователям давать «обратную связь в реальном времени», чтобы «непосредственно влиять на свое взаимодействие» с ChatGPT и выбирать из нескольких личностей ChatGPT.

Откат завершен, на мой взгляд, это не дает почти никаких подробностей о том, как и почему все произошло https://t.co/cYj9iMaiy1

— Алекс Волков (четверг/AI) (@altryne) 30 апреля 2025 г.

«[М]ы изучаем новые способы включения более широкой, демократичной обратной связи в стандартное поведение ChatGPT», — написала компания в своем сообщении в блоге. «Мы надеемся, что обратная связь поможет нам лучше отражать разнообразные культурные ценности по всему миру и понять, как бы вы хотели, чтобы развивался ChatGPT… Мы также считаем, что пользователи должны иметь больше контроля над поведением ChatGPT и, в той степени, в которой это безопасно и осуществимо, вносить коррективы, если они не согласны с стандартным поведением».

Источник