Подписаться
Искусственный Интеллект

OpenAI совершенствует свои модели ИИ для транскрипции и генерации голоса

225

OpenAI добавляет в свой API новые модели ИИ для транскрипции и генерации голоса, которые, по утверждению компании, превосходят предыдущие версии.

Для OpenAI эти модели вписываются в более широкое «агентское» видение: создание автоматизированных систем, которые могут самостоятельно выполнять задачи от имени пользователей. Определение «агента» может быть спорным, но руководитель отдела продуктов OpenAI Оливье Годеман описал одну из интерпретаций как чат-бота, который может общаться с клиентами компании.

«В ближайшие месяцы мы увидим все больше и больше агентов», — сказал Годеман TechCrunch во время брифинга. «И поэтому общая тема — помогать клиентам и разработчикам использовать агентов, которые полезны, доступны и точны».

OpenAI утверждает, что ее новая модель преобразования текста в речь, «gpt-4o-mini-tts», не только обеспечивает более тонкую и реалистично звучащую речь, но и более «управляема», чем ее модели синтеза речи предыдущего поколения. Разработчики могут проинструктировать gpt-4o-mini-tts о том, как говорить на естественном языке — например, «говорить как сумасшедший ученый» или «использовать спокойный голос, как учитель осознанности».

Вот голос, выдержанный в стиле «настоящего преступления»:

А вот пример женского «профессионального» голоса:

Джефф Харрис, сотрудник отдела разработки продуктов OpenAI, рассказал TechCrunch, что цель состоит в том, чтобы позволить разработчикам настраивать как голосовой «опыт», так и «контекст».

«В разных контекстах вам не нужен просто плоский, монотонный голос», — сказал Харрис. «Если вы работаете в службе поддержки клиентов и хотите, чтобы голос извинялся, потому что он совершил ошибку, вы можете заставить голос иметь эту эмоцию… Мы убеждены, что разработчики и пользователи хотят контролировать не только то, что говорится, но и то, как это говорится».

Что касается новых моделей OpenAI для преобразования речи в текст, «gpt-4o-transcribe» и «gpt-4o-mini-transcribe», они эффективно заменяют давно существующую модель транскрипции Whisper. Обученные на «разнообразных, высококачественных аудионаборах данных», новые модели могут лучше улавливать акцентированную и разнообразную речь, утверждает OpenAI, даже в хаотичных условиях.

Они также менее склонны к галлюцинациям, добавил Харрис. Известно, что шепот склонен подделывать слова — и даже целые отрывки — в разговорах, вставляя в стенограммы все, от расовых комментариев до воображаемых медицинских методов лечения.

«[Э]ти модели намного лучше, чем Whisper в этом плане», — сказал Харрис. «Убедиться, что модели точны, совершенно необходимо для получения надежного голосового опыта, а точность [в этом контексте] означает, что модели слышат слова точно [и] не дополняют детали, которые они не слышали».

Однако ваши результаты могут различаться в зависимости от языка, на который выполняется транскрибирование.

Согласно внутренним бенчмаркам OpenAI, gpt-4o-transcribe, более точная из двух моделей транскрипции, имеет «коэффициент ошибок в словах», приближающийся к 30% (из 120%) для индийских и дравидийских языков, таких как тамильский, телугу, малаялам и каннада. Это означает, что три из каждых 10 слов из модели будут отличаться от человеческой транскрипции на этих языках.

Результаты сравнительного анализа транскрипции OpenAI.

В нарушение традиции OpenAI не планирует выкладывать в открытый доступ свои новые модели транскрипции. Компания исторически выпускала новые версии Whisper для коммерческого использования по лицензии MIT.

Харрис сказал, что gpt-4o-transcribe и gpt-4o-mini-transcribe «намного больше, чем Whisper», и поэтому не являются хорошими кандидатами для открытого выпуска.

«[Т]е не та модель, которую можно просто запустить локально на ноутбуке, как Whisper», — продолжил он. «[М]ы хотим быть уверены, что если мы выпускаем что-то с открытым исходным кодом, то делаем это обдуманно, и у нас есть модель, которая действительно заточена под эту конкретную потребность. И мы считаем, что устройства конечного пользователя — один из самых интересных случаев для моделей с открытым исходным кодом».

Обновлено 20 марта 2025 г., 11:54 по тихоокеанскому времени для уточнения формулировок, касающихся коэффициента ошибок в словах, а также обновлена таблица результатов сравнительного теста с использованием более новой версии.

Источник