OpenAI может «скорректировать» свои меры безопасности
OpenAI обновила свою структуру готовности — внутреннюю систему, которую она использует для оценки безопасности моделей ИИ и определения необходимых мер безопасности во время разработки и развертывания. В обновлении OpenAI заявила, что может «скорректировать» свои требования безопасности, если конкурирующая лаборатория ИИ выпустит «высокорисковую» систему без аналогичных мер защиты.
Изменение отражает растущее конкурентное давление на разработчиков коммерческого ИИ, требующее быстрого развертывания моделей. OpenAI обвиняют в снижении стандартов безопасности в пользу более быстрых релизов и в несвоевременном предоставлении отчетов с подробным описанием испытаний безопасности. На прошлой неделе 12 бывших сотрудников OpenAI подали краткую записку по делу Илона Маска против OpenAI, утверждая, что компания будет вынуждена еще больше экономить на безопасности, если завершит запланированную корпоративную реструктуризацию.
Возможно, предвидя критику, OpenAI заявляет, что не будет легкомысленно вносить эти коррективы в политику и сохранит свои меры безопасности на «более высоком уровне защиты».
«Если другой разработчик передового ИИ выпустит высокорисковую систему без сопоставимых мер безопасности, мы можем скорректировать наши требования», — написал OpenAI в сообщении в блоге, опубликованном во вторник днем. «Однако мы сначала строго подтвердим, что ландшафт риска действительно изменился, публично признаем, что мы вносим корректировку, оценим, что корректировка не приведет к существенному увеличению общего риска серьезного вреда, и по-прежнему будем поддерживать меры безопасности на более защитном уровне».
Обновленная структура готовности также ясно показывает, что OpenAI все больше полагается на автоматизированные оценки для ускорения разработки продукта. Компания заявляет, что, хотя она и не отказалась полностью от тестирования под руководством человека, она создала «растущий набор автоматизированных оценок», которые, как предполагается, могут «идти в ногу с [более] более быстрым [выпуском] ритмом».
Некоторые отчеты противоречат этому. По данным Financial Times, OpenAI дала тестировщикам меньше недели на проверки безопасности для предстоящей крупной модели — сжатые сроки по сравнению с предыдущими выпусками. Источники издания также утверждали, что многие из тестов безопасности OpenAI теперь проводятся на более ранних версиях моделей, а не на версиях, выпущенных для общественности.
В своих заявлениях OpenAI оспаривает утверждение о том, что это ставит под угрозу безопасность.
Другие изменения в структуре OpenAI касаются того, как компания классифицирует модели в соответствии с риском, включая модели, которые могут скрывать свои возможности, обходить защитные меры, предотвращать свое отключение и даже самовоспроизводиться. OpenAI заявляет, что теперь она будет фокусироваться на том, соответствуют ли модели одному из двух порогов: «высокая» возможность или «критическая» возможность.
Согласно определению OpenAI, первая модель может «расширить существующие пути к серьезному вреду». Вторая модель — это модели, которые «открывают беспрецедентные новые пути к серьезному вреду», по данным компании.
«Охваченные системы, которые достигают высокой производительности, должны иметь защитные меры, которые в достаточной степени минимизируют связанный с ними риск серьезного вреда до их развертывания», — написала OpenAI в своем сообщении в блоге. «Системы, которые достигают критической производительности, также требуют защитных мер, которые в достаточной степени минимизируют связанные с ними риски во время разработки».
Это первые обновления, которые OpenAI вносит в Рамочную структуру готовности с 2023 года.