Подписаться
Искусственный Интеллект

Утечка данных разоблачает китайскую машину цензуры на основе ИИ

215

Жалоба на бедность в сельской местности Китая. Новостной репортаж о коррумпированном члене Коммунистической партии. Крик о помощи о коррумпированных полицейских, которые вымогают деньги у предпринимателей.

Это лишь некоторые из 133 000 примеров, загруженных в сложную большую языковую модель, которая разработана для автоматической пометки любого фрагмента контента, который китайское правительство считает деликатным.

Утечка базы данных, с которой ознакомился TechCrunch, свидетельствует о том, что Китай разработал систему искусственного интеллекта, которая усиливает и без того грозную машину цензуры, выходя далеко за рамки традиционных табу, таких как бойня на площади Тяньаньмэнь.

Система, по-видимому, в первую очередь ориентирована на цензуру китайских граждан в Интернете, но может использоваться и для других целей, например, для улучшения и без того обширной цензуры китайских моделей искусственного интеллекта.

На этой фотографии, сделанной 4 июня 2019 года, запечатлен китайский флаг за колючей проволокой на жилом комплексе в Енгисаре, к югу от Кашгара, в западном регионе Синьцзян в Китае.

Сяо Цян, исследователь из Калифорнийского университета в Беркли, изучающий китайскую цензуру и также изучивший набор данных, сообщил TechCrunch, что это «явное доказательство» того, что китайское правительство или его аффилированные лица хотят использовать степени магистра права для усиления репрессий.

«В отличие от традиционных механизмов цензуры, которые полагаются на человеческий труд для фильтрации по ключевым словам и ручного просмотра, магистр права, обученный по таким инструкциям, значительно повысит эффективность и детализацию государственного контроля информации», — сказал Цян в интервью TechCrunch.

Это добавляет все больше доказательств того, что авторитарные режимы быстро перенимают новейшие технологии ИИ. Например, в феврале OpenAI заявила, что поймала несколько китайских организаций, использующих LLM для отслеживания антиправительственных постов и очернения китайских диссидентов.

Посольство Китая в Вашингтоне (округ Колумбия) в своем заявлении сообщило TechCrunch, что оно выступает против «беспочвенных нападок и клеветы на Китай» и что Китай придает большое значение развитию этичного ИИ.

Данные, найденные на виду

Набор данных был обнаружен исследователем безопасности NetAskari, который поделился образцом с TechCrunch, обнаружив его в незащищенной базе данных Elasticsearch, размещенной на сервере Baidu.

Это не указывает на какую-либо причастность какой-либо из компаний — самые разные организации хранят свои данные у этих провайдеров.

Нет никаких указаний на то, кто именно создал этот набор данных, но записи показывают, что данные свежие: последние записи датированы декабрем 2024 года.

Степень магистра права по выявлению инакомыслия

На языке, пугающе напоминающем то, как люди задают вопросы ChatGPT, создатель системы поручает неназванному LLM выяснить, имеет ли часть контента какое-либо отношение к деликатным темам, связанным с политикой, общественной жизнью и армией. Такой контент считается «самым приоритетным» и должен быть немедленно помечен.

К приоритетным темам относятся скандалы, связанные с загрязнением окружающей среды и безопасностью пищевых продуктов, финансовое мошенничество и трудовые споры — все это острые вопросы в Китае, которые иногда приводят к публичным протестам, например, протестам против загрязнения окружающей среды в Шифане в 2012 году.

Любая форма «политической сатиры» явно направлена против. Например, если кто-то использует исторические аналогии, чтобы высказать свое мнение о «современных политических деятелях», это должно быть немедленно отмечено, как и все, что связано с «политикой Тайваня». Военные вопросы широко направлены против, включая сообщения о военных передвижениях, учениях и вооружении.

Фрагмент набора данных можно увидеть ниже. Код внутри него ссылается на токены подсказок и LLM, подтверждая, что система использует модель ИИ для выполнения своих торгов.

Из этой огромной коллекции из 133 000 примеров, которые LLM должен оценить на предмет цензуры, TechCrunch выбрал 10 репрезентативных фрагментов контента.

Темы, которые могут вызвать общественные волнения, являются повторяющейся темой. Например, один фрагмент — это пост владельца бизнеса, жалующегося на коррумпированных местных полицейских, которые вымогают деньги у предпринимателей, что становится все более актуальной проблемой в Китае, поскольку его экономика переживает не лучшие времена.

В другом контенте оплакивается сельская бедность в Китае, описываются захудалые города, в которых остались только старики и дети. Также есть новостной репортаж о том, как Коммунистическая партия Китая (КПК) выгнала местного чиновника за серьезную коррупцию и веру в «суеверия» вместо марксизма.

Существует обширный материал, связанный с Тайванем и военными вопросами, например, комментарии о военных возможностях Тайваня и подробности о новом китайском истребителе. Одно только китайское слово для Тайваня (台湾) упоминается в данных более 15 000 раз, как показывает поиск TechCrunch.

Похоже, что и тонкое инакомыслие тоже подвергается нападкам. Один фрагмент, включенный в базу данных, представляет собой анекдот о мимолетной природе власти, в котором используется популярная китайская идиома «Когда падает дерево, обезьяны разбегаются».

Переход власти является особенно щекотливой темой в Китае из-за его авторитарной политической системы.

Набор данных не содержит никакой информации о его создателях. Но в нем говорится, что он предназначен для «работы с общественным мнением», что дает веский намек на то, что он призван служить целям китайского правительства, сказал один эксперт TechCrunch.

Майкл Кастер, менеджер азиатской программы правозащитной организации Article 19, пояснил, что «работа по формированию общественного мнения» контролируется влиятельным китайским правительственным регулятором — Управлением по киберпространству Китая (CAC), и обычно подразумевает цензуру и пропаганду.

Конечная цель — обеспечить защиту китайских правительственных нарративов в сети, в то время как любые альтернативные взгляды будут вычищены. Сам председатель КНР Си Цзиньпин назвал интернет «передовой линией» «работы КПК по формированию общественного мнения».

Набор данных, изученный TechCrunch, является последним доказательством того, что авторитарные правительства стремятся использовать ИИ в репрессивных целях.

В прошлом месяце компания OpenAI опубликовала отчет, в котором говорится, что неизвестный субъект, вероятно, работающий из Китая, использовал генеративный ИИ для мониторинга разговоров в социальных сетях, особенно тех, которые пропагандируют протесты за права человека против Китая, и пересылал их китайскому правительству.

OpenAI также обнаружила, что технология используется для генерации комментариев, резко критикующих известного китайского диссидента Цай Ся.

Традиционно методы цензуры в Китае основаны на более простых алгоритмах, которые автоматически блокируют контент, содержащий упоминания занесенных в черный список терминов, таких как «резня на площади Тяньаньмэнь» или «Си Цзиньпин», с чем многие пользователи столкнулись впервые, используя DeepSeek.

Но более новые технологии ИИ, такие как LLM, могут сделать цензуру более эффективной, обнаруживая даже тонкую критику в больших масштабах. Некоторые системы ИИ также могут продолжать совершенствоваться, поглощая все больше и больше данных.

«Я считаю, что крайне важно подчеркнуть, как развивается цензура на основе ИИ, делая государственный контроль над общественным дискурсом еще более изощренным, особенно в то время, когда китайские модели ИИ, такие как DeepSeek, вызывают ажиотаж», — сказал Сяо, исследователь из Беркли, в интервью TechCrunch.

Источник