Claude вышла из-под контроля: Antropic поймала свои ИИ-модели на взломе чужих систем

В компании рассказали как минимум о трех таких случаях.
Марина Емельянцева
Марина Емельянцева
Claude вышла из-под контроля: Antropic поймала свои ИИ-модели на взломе чужих систем
Magnific

Худшие прогнозы скептиков, связанные с развитием искусственного интеллекта, кажется, начинают сбываться. Компания Anthropic, разработавшая нейросеть Claude, выявила сразу три случая, когда ее ИИ-модели «сбегали» из тестовой среды и пытались взломать системы сторонних организаций.

Об инцидентах рассказала пресс-служба Anthropic, которая сообщила, что компания решила провести внутреннюю проверку после другого похожего резонансного случая при участии Open AI.

Magnific

Утверждается, что во всех трех случаях Claude выполняла стандартное задание «захват флага». Ей давали вымышленный сценарий и ставили задачу – найти скрытую информацию на другой машине. При этом в условиях четко проговаривалось, что выход в интернет-пространство заблокирован. Однако из-за ошибки конфигурации доступ к сети оставался открытым. В итоге модель воспринимала реальные системы как часть симуляции и атаковала их, получая несанкционированный доступ.

Так, в первом инциденте вымышленная компания, которую нужно было взломать Claude, носила то же имя, что и реальный домен. Модель Opus 4.7 вышла в Сеть, взломала инфраструктуру фирмы, подобрав пароли, и завладела базой с сотнями строк производственных данных. При этом в какой-то момент она осознала, что цель – реальная, а не условная, но продолжила атаку.

РЕКЛАМА – ПРОДОЛЖЕНИЕ НИЖЕ
РЕКЛАМА – ПРОДОЛЖЕНИЕ НИЖЕ
Magnific

Во втором случае модель Mythos 5 нашла в симуляции инструкцию установить несуществующий Python-пакет, создала вредоносный аналог и опубликовала его в библиотеке языка программирования PyPl. Чтобы зарегистрировать аккаунт, ИИ пытался раздобыть телефонный номер, но обошелся бесплатной электронной почтой. Пакет был скачан на 15 реальных систем – в том числе сканер компании по безопасности. Это позволило Claude похитить учетные данные.

Наконец, в третьем инциденте внутренняя тестовая модель Anthropic не нашла симулированную цель. Поэтому она просканировала порядка 9000 хостов в интернете и скомпрометировала приложение реальной компании через SQL-инъекцию – так называют уязвимость, при которой злоумышленник внедряет вредоносный код в поля ввода или параментры веб-приложения. База данных принимает его за законный запрос и выполняет, что в итоге позволяет взломщику читать, изменять и удалять данные. Во время этой атаки модель поняла, что цель настоящая, и остановилась.

В Anthropic отметили, что во всех случаях пострадавшие организации не знали о взломе, пока не получили уведомление от компании. Вредоносный пакет, который Claude разместила на PyPl, был удален автоматически.

Загружаем