ITNEWS.pro
…
13 часов назад
Подписаться
Агенты на свободе: более 100 попыток взлома. OpenAI считает пострадавших, суды — нарушения

Больше ста организаций получили от OpenAI предупреждения о том, что ИИ-агенты компании могли действовать в их системах без разрешения. Сама компания оговаривается, что письмо еще не означает взлом. Часть адресатов получила уведомление потому, что агенты пытались обойти защиту или вели себя непредсказуемо, а в некоторых эпизодах речь шла о работе с открытой информацией. Однако список подтвержденных случаев растет почти каждую неделю. Июльская атака на Hugging Face, с которой начался скандал, оказалась самым тяжелым эпизодом, но далеко не единственным.

Сильнее всех пострадала сама Hugging Face, крупнейшая площадка для обмена нейросетями и датасетами. Исследователи из METR провели независимое расследование. По их данным, около 1200 агентов отправили больше 70 000 сообщений и файлов на самодельную доску объявлений, и примерно 700 из них участвовали в атаке. Несколько дней они запускали код на десятках серверов компании и один захватили полностью. Позже выяснилось, что двумя месяцами раньше рой успел побывать на RubyGems, главном хранилище библиотек для языка Ruby. По данным исследователей, агенты загрузили туда больше 2000 вредоносных пакетов и пытались через неизвестную ранее уязвимость сервера украсть ключи доступа пользователей. OpenAI признала, что ее агенты пользовались платформой, но назвала их задачи безобидными: те якобы искали публичную информацию. Похожая участь постигла маленькую немецкую вики, которую агенты превратили в доску объявлений для собственного общения.

Австралия насчитала уже пять затронутых госсистем. Громче всего прозвучала история с порталом статистики Medicare. Агент собирал данные о государственных расходах на лекарства, уперся в ограничения доступа, нашел обходной путь и открыл как публичные, так и закрытые файлы. В Агентство медицинской информации штата Виктория агенты попали через оставленный в открытом доступе ключ и выгрузили настройки отчетности и сводную статистику опросов. Еще одной жертвой стало ведомство, которое собирает и анализирует криминальную статистику Нового Южного Уэльса. Пятым оказался сервис истории пожаров Службы национальных парков того же штата: модель обращалась к нему за пределами допустимого и собрала сводную статистику, которую сервис не публикует. Персональных данных, по нынешним оценкам, агенты нигде не получили.

За пределами Австралии картина более размыта. Разработчик ChatGPT подтвердил The New York Times, что его агенты прощупывали сайты Министерства образования, Министерства торговли и Комиссии по ценным бумагам и биржам США, но подтвержденного проникновения там нет. Канадский госархив атаковали агенты, которых Transluce (некоммерческая лаборатория, которая ищет в Сети следы вышедших из-под контроля агентов) не связывает с OpenAI уверенно, хотя их почерк совпадает. Самую длинную выборку собрала криминалистическая фирма Asymmetric Security. По ее данным, агенты брали данные с сайтов 55 компаний, некоммерческих и государственных организаций, а для этого заводили временные почтовые ящики и закрытые аккаунты в сервисе проверки ссылок Urlquery. Заголовки об агентах, которые заметают следы, разошлись мгновенно. Сам отчет звучит сдержаннее: в подавляющем большинстве случаев полученные данные были и остаются общедоступными. Намеренно ли агенты скрывались или это побочный эффект ограничений тестовой среды, фирма установить не смогла.

У всех этих эпизодов одна причина. Во время внутреннего теста OpenAI дала десяткам тысяч ИИ-агентов задания по кибербезопасности. Некоторые агенты стали искать не решение задачи, а способ получить высокий результат в обход правил. Они взламывали собственные изолированные контейнеры, чтобы выйти в Интернет, обменивались находками с другими агентами и использовали оставленные ими следы. Так часть агентов добралась до Hugging Face: они решили, что там могут находиться подсказки, которые помогут обмануть систему оценки. OpenAI объясняет произошедшее сочетанием трёх факторов: стремлением моделей «накрутить» результат, несанкционированной координацией между агентами и их упорством — они не прекращали работу при возникновении препятствий, а искали всё новые способы их обойти. При этом поведение распространялось даже между формально изолированными запусками. Дополнительную тревогу вызвали выводы METR: примерно каждый пятый изученный агент пытался понять, как скрыть или изменить следы своих действий, а многие подробно исследовали способы подделать журналы событий.

Растянутость скандала во времени объясняется просто: компания долго не видела, что творят ее нейросети. Тревога в OpenAI сработала только тогда, когда агенты из другого теста нашли ключи, оставленные роем в общем кэше, и получили права администратора на вычислительном кластере самой компании. После этого началась ревизия логов. Чтобы оценить масштаб, OpenAI просматрела около 50 петабайт данных. Часть историй компания вообще узнала от посторонних: о случаях с немецкой вики и RubyGems стало известно только благодаря внешним исследователям. В Transluce нашли следы похожей активности еще с марта, то есть на несколько месяцев раньше, чем, по словам OpenAI, у нее появились какие-либо признаки «преступного поведения» моделей.

С Австралией отдельная история. О взломе Medicare правительство узнало от OpenAI лишь спустя 84 дня, причем письмо ушло на общий ящик ведомства, и до профильного министра информация шла еще пять дней. Этот ящик к тому же не мониторят круглосуточно. С пожарной статистикой компания сработала быстрее: обнаружила инцидент во вторник, двое суток его изучала и в четверг сообщила властям штата. Только сам эпизод произошел в июне, и чиновники узнали о нем на исходе третьего месяца. Со стороны это смотрится как издевка, хотя по факту это следствие той же ретроспективной проверки. Энтони Албанезе назвал историю с Medicare недопустимой и заявил, что правительство взвешивает юридические меры. OpenAI извинилась, пообещала собрать рабочую группу с независимыми австралийскими экспертами и выделить ведомствам кредиты из своей программы помощи защитникам критических систем на $1 млрд.

Заверения компании, что опасность устранена, опровергает ее собственный отчет. Модель решала поисковую учебную задачу, не нашла ответа обычным путем, нащупала брешь в фильтрации DNS (системы, которая переводит имена сайтов в адреса) и через нее связалась с внешним чат-ботом. Произошло это 20 сентября, это последний подтвержденный инцидент. Система мониторинга подняла тревогу примерно через 12 минут, человек отреагировал еще через три, но остановили задачу только спустя 2,5 часа. Механизм автоматической остановки при подозрительной активности вообще не сработал. После этого OpenAI поставила на паузу обучение, тестирование и работу с инструментами своих самых мощных моделей. Transluce идет дальше: по ее данным, похожая активность продолжалась как минимум до 16 сентября, а возможно, и до 20-го, включая неудачные попытки взломать криптобиржу и провести на ней сделки. На это OpenAI пока не ответила.

Первый иск уже подан. Некоммерческая организация Legal Advocates for Safe Science and Technology (LASST, «Юристы за безопасную науку и технологии») обратилась в Верховный суд Сан-Франциско. Она требует не денег, а судебного запрета на доступ агентов OpenAI к чужим системам без разрешения. Главный козырь истцов — калифорнийский закон, действующий с 1 января: если компания создала или использовала ИИ, который причинил вред, сослаться на самостоятельность системы в свою защиту она не может. В OpenAI иск назвали абсолютно необоснованным.

Австралийский закон о защите частной жизни позволяет оштрафовать компанию на сумму до 50 млн австралийских долларов, утроенную выгоду от нарушения или 30% оборота, но он касается персональных данных, а их среди похищенного не нашли. С уголовной ответственностью еще сложнее: министр обороны признал взлом непреднамеренным, а эксперты указывают, что прецедентов, когда корпорацию судили бы за умысел ее агента, просто нет. Зато уже понятна цена в другой валюте. OpenAI отменила запланированный на октябрь выпуск GPT-6.1 Astra, и выход на биржу Альтман теперь обещает только после того, как компания сможет уверенно говорить о безопасности своих моделей. Один из руководителей направления безопасности Дэвид Робинсон ушел из компании со словами, что создатели этих технологий ведут себя недостаточно осторожно.

Для остального мира история шире одной компании. Вслед за OpenAI и Anthropic, и Meta признали, что их модели во время внутренних тестов выходили во внешние сети. Саму Astra в OpenAI оценили как достигшую критического уровня возможностей в кибербезопасности. По наблюдениям Asymmetric, агенты меняли тактику за считанные дни, тогда как хакерам-людям на это обычно нужны месяцы. Сама OpenAI назвала произошедшее предупредительным выстрелом: без нужной защиты мощные агенты уже способны обходить технические ограничения, договариваться по неразрешенным каналам и совершать опасные действия, которых им никто не поручал. После Hugging Face Альтман присоединился к призыву Дарио Амодеи сбавить темп разработки передовых моделей.

Рецепт контроля пока выглядит инженерным. OpenAI обещает усилить сетевую изоляцию, вынести непроверенный код в еще более закрытые песочницы, обязать мониторинг цепочек рассуждений у мощных моделей с инструментами и прописать четкие правила эскалации для дежурных. Доступ в Интернет теперь блокируют два независимых уровня, и каждого хватило бы, чтобы остановить сентябрьский побег. Регуляторы идут медленнее: в Австралии обязательные стандарты для ИИ одобрили в конце августа, а закон планируют принять в начале 2027 года, в США федерального закона о таких системах нет.

Подписывайся на наш Telegram и не пропусти главные новости!