OpenAI почти неделю не знала, что Hugging Face взломал её собственный ИИ-агент

Это многое говорит о безопасности внутри компании.
Антон Попов
Антон Попов
OpenAI почти неделю не знала, что Hugging Face взломал её собственный ИИ-агент
Unsplash

OpenAI выяснила, что за июльским взломом платформы Hugging Face стоял один из ее собственных ИИ-агентов, лишь спустя несколько дней после первых признаков сбоя. Об этом сообщает Reuters со ссылкой на источники, знакомые с ходом расследования.

По данным собеседников агентства, около 9 июля агент начал предпринимать попытки покинуть изолированную среду тестирования. Уже 11 июля он получил доступ к инфраструктуре Hugging Face и оставался активным до 13 июля. Эти даты Reuters подтвердил сооснователь платформы Томас Вольф.

Unsplash
РЕКЛАМА – ПРОДОЛЖЕНИЕ НИЖЕ
РЕКЛАМА – ПРОДОЛЖЕНИЕ НИЖЕ

16 июля Hugging Face сообщила о взломе, совершенном «автономной системой ИИ-агентов». Как утверждают источники Reuters, только после этой публикации в OpenAI начали связывать инцидент со своей разработкой. Окончательно установить происхождение атаки удалось 18–19 июля, когда сотрудники компании обнаружили в логах признаки того, что агент вышел за пределы тестовой среды.

Первый контакт между OpenAI и Hugging Face состоялся около 20 июля, а публично OpenAI раскрыла детали происшествия 21 июля. К этому моменту Hugging Face уже уведомила о случившемся Федеральное бюро расследований США.

Как пишет Reuters, признаки необычного поведения моделей фиксировались еще до атаки. По словам трех источников, один из агентов оставлял внутри инфраструктуры OpenAI заметки, предположительно адресованные своим будущим версиям. В них содержались рассуждения о том, как ИИ-системы могут обходить внутренние ограничения компании. Кроме того, во время более ранних испытаний исследователи сталкивались со случаями отключения систем мониторинга. При этом Reuters не удалось подтвердить связь этих эпизодов с агентом, который впоследствии атаковал Hugging Face.

РЕКЛАМА – ПРОДОЛЖЕНИЕ НИЖЕ
Unsplash

Источники агентства объясняют задержку с обнаружением атаки особенностями процесса тестирования. OpenAI одновременно проводит большое количество оценок моделей, а объем генерируемых данных настолько велик, что специалисты не всегда успевают оперативно анализировать все журналы событий.

В OpenAI назвали произошедшее беспрецедентным инцидентом и «важным моментом для безопасности ИИ». Компания заявила, что проводит расследование совместно с внешними консультантами и позже опубликует технический отчёт. Представитель OpenAI также сообщила Reuters о наличии «нескольких неточностей» в публикации агентства, не уточнив, какие именно сведения вызвали вопросы.

21 июля OpenAI признала, что один из ее ИИ-агентов сумел покинуть тестовую среду и получить несанкционированный доступ к инфраструктуре Hugging Face во время оценки кибербезопасностных возможностей моделей. По данным компании, целью агента было получение преимуществ в бенчмарке ExploitGym, который использовался в рамках внутренних испытаний.

Загружаем