Демис Хассабис заявил, что Google в итоге объединит свои модели Gemini и Veo
В недавнем выступлении на подкасте Possible, ведущим которого является соучредитель LinkedIn Рид Хоффман, генеральный директор Google DeepMind Демис Хассабис заявил, что поисковый гигант планирует в конечном итоге объединить свои модели искусственного интеллекта Gemini с моделями генерации видео Veo, чтобы улучшить понимание физического мира первыми.
«Мы всегда создавали Gemini, нашу базовую модель, как мультимодальную с самого начала», — сказал Хассабис. «И причина, по которой мы это сделали, [заключается в том, что] у нас есть видение этой идеи универсального цифрового помощника, помощника, который […] действительно помогает вам в реальном мире».
Индустрия ИИ постепенно движется к моделям «omni», если можно так выразиться — моделям, которые могут понимать и синтезировать множество форм медиа. Новейшие модели Gemini от Google могут генерировать аудио, а также изображения и текст, в то время как модель OpenAI по умолчанию в ChatGPT теперь может создавать изображения — включая, конечно, арт в стиле Studio Ghibli. Amazon также объявила о планах запустить модель «any-to-any» в конце этого года.
Эти омни-модели требуют большого количества обучающих данных — изображений, видео, аудио, текста и т. д. Хассабис намекнул, что видеоданные для Veo в основном поступают с YouTube, платформы, которой владеет Google.
«По сути, просматривая видео на YouTube — а их там очень много — [Veo 2] может понять, знаете ли, физику мира», — сказал Хассабис.
Google ранее сообщил TechCrunch, что его модели «могут» обучаться на «некотором» контенте YouTube в соответствии с соглашением с создателями YouTube. Как сообщается, в прошлом году компания расширила свои условия обслуживания, чтобы частично использовать больше данных для обучения своих моделей ИИ.