Подписаться
Искусственный Интеллект

Microsoft изучает возможность признания вкладчиков данных обучения ИИ

209

Microsoft запускает исследовательский проект по оценке влияния конкретных обучающих примеров на текст, изображения и другие типы медиа, создаваемые генеративными моделями ИИ.

Об этом говорится в объявлении о вакансии, опубликованном в декабре и недавно распространенном на LinkedIn.

Согласно объявлению о поиске стажера-исследователя, проект попытается продемонстрировать, что модели можно обучать таким образом, чтобы влияние конкретных данных — например, фотографий и книг — на их результаты можно было «эффективно и с пользой оценить».

«Текущие архитектуры нейронных сетей непрозрачны с точки зрения предоставления источников для своих поколений, и есть […] веские причины изменить это», — говорится в листинге. «[Одной из причин] являются стимулы, признание и потенциальная оплата для людей, которые вносят определенные ценные данные в непредвиденные виды моделей, которые нам понадобятся в будущем, предполагая, что будущее нас существенно удивит».

Генераторы текста, кода, изображений, видео и песен на основе ИИ находятся в центре ряда исков по правам интеллектуальной собственности против компаний, занимающихся ИИ. Часто эти компании обучают свои модели на огромных объемах данных с общедоступных веб-сайтов, некоторые из которых защищены авторским правом. Многие компании утверждают, что доктрина добросовестного использования защищает их методы сбора данных и обучения. Но творческие люди — от художников до программистов и авторов — в основном не согласны.

Сама компания Microsoft столкнулась как минимум с двумя юридическими проблемами со стороны владельцев авторских прав.

В декабре The New York Times подала в суд на технологического гиганта и его бывшего партнера OpenAI, обвинив обе компании в нарушении авторских прав The Times путем развертывания моделей, обученных на миллионах ее статей. Несколько разработчиков программного обеспечения также подали иск против Microsoft, утверждая, что помощник по кодированию GitHub Copilot AI от этой компании был незаконно обучен с использованием их защищенных работ.

В новом исследовательском проекте Microsoft, который в листинге описывается как «происхождение во время обучения», как сообщается, участвует Джарон Ланье, опытный технолог и междисциплинарный ученый из Microsoft Research. В статье в The New Yorker за апрель 2023 года Ланье писал о концепции «достоинства данных», которая для него означала связь «цифровых вещей» с «людьми, которые хотят быть известными за то, что они их создали».

«Подход на основе данных позволит отслеживать самых уникальных и влиятельных участников, когда большая модель обеспечивает ценный результат», — пишет Ланье. «Например, если вы попросите модель сделать «мультфильм о моих детях в мире масляной живописи с говорящими котами в приключении», то определенные ключевые художники маслом, портретисты кошек, актеры озвучивания и писатели — или их наследники — могут быть подсчитаны как имеющие уникальное значение для создания нового шедевра. Они будут признаны и мотивированы. Им даже могут заплатить».

Недаром уже несколько компаний пытаются это сделать. Разработчик модели ИИ Bria, недавно привлекший 40 миллионов долларов венчурного капитала, утверждает, что «программно» компенсирует владельцам данных в соответствии с их «общим влиянием». Adobe и Shutterstock также выплачивают регулярные выплаты тем, кто вносит вклад в набор данных, хотя точные суммы выплат, как правило, непрозрачны.

Немногие крупные лаборатории создали индивидуальные программы выплат участникам за пределами лицензионных соглашений с издателями, платформами и брокерами данных. Вместо этого они предоставили владельцам авторских прав возможность «отказаться» от обучения. Но некоторые из этих процессов отказа обременительны и применяются только к будущим моделям, а не к ранее обученным.

Конечно, проект Microsoft может оказаться не более чем проверкой концепции. Для этого есть прецедент. Еще в мае OpenAI заявила, что разрабатывает похожую технологию, которая позволит создателям указывать, как они хотят, чтобы их работы включались в данные обучения — или исключались из них. Но почти год спустя инструмент так и не увидел свет, и зачастую его не рассматривали как приоритетный внутри компании.

Microsoft также может пытаться «отмыть этические нормы» — или предотвратить принятие регулирующих и/или судебных решений, которые могут нанести ущерб ее бизнесу в сфере ИИ.

Но то, что компания изучает способы отслеживания данных обучения, примечательно в свете недавно выраженных позиций других лабораторий ИИ по поводу добросовестного использования. Несколько ведущих лабораторий, включая Google и OpenAI, опубликовали политические документы, рекомендующие администрации Трампа ослабить защиту авторских прав в отношении разработки ИИ. OpenAI открыто призвала правительство США кодифицировать добросовестное использование для обучения моделей, что, по ее мнению, освободит разработчиков от обременительных ограничений.

Компания Microsoft не сразу отреагировала на просьбу прокомментировать ситуацию.

Источник