Pruna AI открывает исходный код своей среды оптимизации модели ИИ
Pruna AI, европейский стартап, работающий над алгоритмами сжатия для моделей ИИ, в четверг открывает исходный код своей среды оптимизации.
Pruna AI создает фреймворк, который применяет несколько методов повышения эффективности, таких как кэширование, обрезка, квантизация и дистилляция, к заданной модели ИИ.
«Мы также стандартизируем сохранение и загрузку сжатых моделей, применяем комбинации этих методов сжатия, а также оцениваем вашу сжатую модель после ее сжатия», — рассказал TechCrunch соучредитель и технический директор Pruna AI Джон Рачван.
В частности, фреймворк Pruna AI может оценить, происходит ли значительная потеря качества после сжатия модели, а также получаемый при этом прирост производительности.
«Если использовать метафору, мы похожи на то, как Hugging Face стандартизировала трансформаторы и диффузоры — как их вызывать, как их сохранять, загружать и т. д. Мы делаем то же самое, но для методов эффективности», — добавил он.
Крупные лаборатории ИИ уже используют различные методы сжатия. Например, OpenAI полагается на дистилляцию для создания более быстрых версий своих флагманских моделей.
Вероятно, именно так OpenAI разработала GPT-4 Turbo, более быструю версию GPT-4. Аналогично, модель генерации изображений Flux.1-schnell является дистиллированной версией модели Flux.1 от Black Forest Labs.
Дистилляция — это метод, используемый для извлечения знаний из большой модели ИИ с моделью «учитель-ученик». Разработчики отправляют запросы модели учителя и записывают выходные данные. Иногда ответы сравниваются с набором данных, чтобы увидеть, насколько они точны. Затем эти выходные данные используются для обучения модели ученика, которая обучается приближаться к поведению учителя.
«Крупные компании обычно занимаются тем, что создают эти штуки внутри компании. А то, что вы можете найти в мире открытого исходного кода, обычно основано на отдельных методах. Например, скажем, один метод квантования для LLM или один метод кэширования для диффузионных моделей», — сказал Рачван. «Но вы не можете найти инструмент, который объединяет их все, делает их все простыми в использовании и объединяет вместе. И это большая ценность, которую Pruna приносит прямо сейчас».
Слева направо: Райан Найт Мази, Бертран Шарпантье, Джон Рахван, Стефан Гюннеманн Авторы изображений: Pruna AI
Хотя Pruna AI поддерживает любые типы моделей, от больших языковых моделей до моделей диффузии, моделей преобразования речи в текст и моделей компьютерного зрения, в настоящее время компания уделяет больше внимания моделям генерации изображений и видео.
Некоторые из существующих пользователей Pruna AI включают Scenario и PhotoRoom. В дополнение к версии с открытым исходным кодом, Pruna AI имеет корпоративное предложение с расширенными функциями оптимизации, включая агент оптимизации.
«Самой захватывающей функцией, которую мы скоро выпустим, станет агент сжатия», — сказал Рачван. «По сути, вы даете ему свою модель, говорите: «Я хочу больше скорости, но не снижайте точность больше, чем на 2%». А затем агент просто сделает свое волшебство. Он найдет для вас лучшую комбинацию и вернет ее вам. Вам как разработчику ничего не нужно делать».
Pruna AI взимает почасовую плату за свою профессиональную версию. «Это похоже на то, как вы думаете о GPU, когда арендуете GPU на AWS или любом облачном сервисе», — сказал Рачван.
И если ваша модель является критической частью вашей инфраструктуры ИИ, вы в конечном итоге сэкономите много денег на выводе с оптимизированной моделью. Например, Pruna AI уменьшила модель Llama в восемь раз без особых потерь, используя свой фреймворк сжатия. Pruna AI надеется, что ее клиенты будут рассматривать фреймворк сжатия как инвестицию, которая окупает себя.
Несколько месяцев назад Pruna AI привлекла $6,5 млн посевного финансирования. Среди инвесторов стартапа — EQT Ventures, Daphni, Motier Ventures и Kima Ventures.