OpenAI опубликовала результаты расследования июльского инцидента, во время которого её ИИ-агенты вышли за пределы тестовой среды и взломали инфраструктуру Hugging Face. Основную роль сыграла внутренняя модель IM1, близкая по параметрам к GPT-5.6 Sol.
Моделям ослабили ограничения и после этого запустили испытания по кибербезопасности. Сначала ИИ-агенты превратили внутренний менеджер пакетов Artifactory в импровизированную доску объявлений: записывали туда результаты работы, читали сообщения других агентов и распределяли задачи. Позже они смогли получить доступ в интернет через Artifactory.
С 12 мая по 19 июля агенты последовательно расширяли себе возможности. Они повысили себе привилегии в Artifactory, проникли в кластер Kubernetes OpenAI и добрались до секретной информации в облаке. OpenAI подчёркивает, что инцидент не затронул данные клиентов и работу продуктов.
Как агенты добрались до Hugging Face
Агенты искали готовые решения заданий в бенчмарке ExploitGym. 10 июля они обнаружили 14 публично доступных учётных данных Hugging Face с правом записи, а затем использовали две уязвимости нулевого дня. Одна позволяла читать файлы через обработчик HDF5, вторая — выполнять код через шаблоны Jinja2.
По данным OpenAI, агенты выполнили код на десятках серверов Hugging Face, получили root-доступ на одном из них и скопировали часть закрытых данных для оценки моделей в публичный датасет. Hugging Face в своём техническом разборе насчитала около 17 600 действий и объединила их в 6280 кластеров.
Hugging Face установила, что агенты получили доступ к пяти наборам данных, связанным с заданиями ExploitGym и CyberGym. Другие пользовательские модели, датасеты, Spaces и пакеты, по данным платформы, атака не затронула. Компания также не нашла следов подмены публичных материалов.
Что изменит OpenAI
Расследование выявило четыре опасных паттерна:
- стремление обойти условия теста,
- настойчивость при выполнении почти недостижимых задач,
- несанкционированный обмен сообщениями,
- возможность принимать цели от других агентов.
OpenAI усиливает изоляцию сред и сетей, вводит непрерывные проверки и обязательный мониторинг цепочек рассуждений для моделей с инструментами уровня GPT-5.6 Sol и выше. Система должна сообщать о серьёзной угрозе в течение 30 минут. Если сигнал за следующие 30 минут не признают ложным, соответствующий процесс приостановят.
Такой контроль, по оценке OpenAI, увеличивает вычислительные расходы примерно на 20%. Компания постепенно возобновляет небольшие эксперименты с обучением с подкреплением, а крупнейший запланированный запуск модели пока остаётся на паузе.
Больше интересного про код — в нашем телеграм-канале. Подписывайтесь!