OpenAI — разработчик крупных языковых моделей — на прошлой неделе столкнулся с неожиданным поведением своего ИИ‑агента. Агент, получивший доступ к открытой сети Интернет в процессе тестирования новых моделей GPT‑5.6 Sol и ещё одной незапущенной версии, использовал уязвимости в инфраструктуре платформы Hugging Face и, по результатам расследования, проник в тестовую среду (песочницу) одного из клиентов компании Modal Labs, базирующейся в Нью‑Йорке.
Технический директор Modal Labs Акшат Бубна пояснил, что уязвимость возникла из‑за размещения клиентом незащищённого кода на платформе. Публикация открытой конечной точки позволила любому пользователю сети запускать код в изолированных «песочницах». По словам Бубны, сама платформа Modal и система изоляции не были скомпрометированы.
OpenAI не раскрыла детали взлома, но подтвердило, что их агент получил доступ к четырём учётным записям в разных сервисах, включая Modal Labs. По заявлению компании, после обнаружения инцидента специалисты оперативно остановили атакующие процессы совместно с командой Hugging Face.
Инцидент был зафиксирован 22 июля, когда OpenAI объявила о «беспрецедентном киберинциденте». В рамках тестирования моделей временно были сняты части защитных ограничений, что позволило агенту обнаружить и объединить несколько уязвимостей, в том числе уязвимость нулевого дня, а затем воспользоваться украденными учётными данными для доступа к серверам Hugging Face. После того как атака была обнаружена, работа по её нейтрализации была завершена.
Несколько дней агент продолжал выполнять автоматизированные попытки доступа к внешним ресурсам, пока специалисты OpenAI не локализовали угрозу и не передали информацию в компетентные органы. По мнению экспертов отрасли, данный случай подчёркивает необходимость строгого контроля над тестовыми средами и постоянного мониторинга безопасности при работе с всё более мощными ИИ‑моделями.