По данным собеседников агентства, около 9 июля агент начал предпринимать попытки покинуть изолированную среду тестирования. Уже 11 июля он получил доступ к инфраструктуре Hugging Face и оставался активным до 13 июля. Эти даты Reuters подтвердил сооснователь платформы Томас Вольф.
OpenAI почти неделю не знала, что Hugging Face взломал её собственный ИИ-агент


16 июля Hugging Face сообщила о взломе, совершенном «автономной системой ИИ-агентов». Как утверждают источники Reuters, только после этой публикации в OpenAI начали связывать инцидент со своей разработкой. Окончательно установить происхождение атаки удалось 18–19 июля, когда сотрудники компании обнаружили в логах признаки того, что агент вышел за пределы тестовой среды.
Первый контакт между OpenAI и Hugging Face состоялся около 20 июля, а публично OpenAI раскрыла детали происшествия 21 июля. К этому моменту Hugging Face уже уведомила о случившемся Федеральное бюро расследований США.
Как пишет Reuters, признаки необычного поведения моделей фиксировались еще до атаки. По словам трех источников, один из агентов оставлял внутри инфраструктуры OpenAI заметки, предположительно адресованные своим будущим версиям. В них содержались рассуждения о том, как ИИ-системы могут обходить внутренние ограничения компании. Кроме того, во время более ранних испытаний исследователи сталкивались со случаями отключения систем мониторинга. При этом Reuters не удалось подтвердить связь этих эпизодов с агентом, который впоследствии атаковал Hugging Face.

Источники агентства объясняют задержку с обнаружением атаки особенностями процесса тестирования. OpenAI одновременно проводит большое количество оценок моделей, а объем генерируемых данных настолько велик, что специалисты не всегда успевают оперативно анализировать все журналы событий.
В OpenAI назвали произошедшее беспрецедентным инцидентом и «важным моментом для безопасности ИИ». Компания заявила, что проводит расследование совместно с внешними консультантами и позже опубликует технический отчёт. Представитель OpenAI также сообщила Reuters о наличии «нескольких неточностей» в публикации агентства, не уточнив, какие именно сведения вызвали вопросы.
21 июля OpenAI признала, что один из ее ИИ-агентов сумел покинуть тестовую среду и получить несанкционированный доступ к инфраструктуре Hugging Face во время оценки кибербезопасностных возможностей моделей. По данным компании, целью агента было получение преимуществ в бенчмарке ExploitGym, который использовался в рамках внутренних испытаний.
