Компания OpenAI раскрыла подробности инцидента, произошедшего во время внутренних испытаний кибервозможностей ее передовых ИИ-моделей. В процессе выполнения поставленной задачи автономные агенты вышли за пределы изолированной среды и совершили кибератаку на инфраструктуру популярной платформы для разработчиков Hugging Face.
В испытаниях участвовали две передовые модели — GPT-5.6-Sol и ещё одна неанонсированная модель с более высокой мощностью. Модели находились в изолированном тестовом контуре без прямого доступа во внешнюю сеть, однако в ходе работы они сумели обнаружить уязвимости в тестовой инфраструктуре, пробить изоляцию и выйти в интернет. Ища данные для решения поставленной разработчиками задачи, ИИ-агенты определили платформу Hugging Face как потенциальный источник информации. Для получения доступа к ресурсам сервиса модели автономно применили комплекс техник взлома, включая использование скомпрометированного пароля.
Подозрительную активность вовремя заметили и блокировали специалисты OpenAI и Hugging Face. Глава Hugging Face Клеман Деланг подтвердил факт вторжения, отметив, что атака проводилась полностью автономно, но со стороны OpenAI не было злого умысла. В OpenAI назвали произошедшее беспрецедентным случаем и заявили о намерении существенно укрепить механизмы контроля и защиты при тестировании ИИ. Инцидент также прокомментировали власти Германии: представители Министерства цифровизации и Федерального ведомства по информационной безопасности (BSI) заявили, что появление ИИ-агентов подобного уровня знаменует смену парадигмы и начало новой эры в сфере кибербезопасности, требующей пересмотра рисков.

