Большинство ведущих разработчиков искусственного интеллекта не опубликовали протоколы действий на случай, если их модели попытаются обойти контроль человека.
Мы обречены? Оказалось, у ИИ-компаний нет плана на случай выхода нейросетей из-под контроля

К такому выводу пришла организация Guidelight AI Standards в ходе исследования готовности пяти крупнейших лабораторий — Anthropic, Google, OpenAI, Meta* (организация признана экстремистской, ее деятельность запрещена на территории Российской Федерации) и xAI — к критическим сценариям.
Аналитики изучили все доступные материалы: системные карты, фреймворки безопасности, отчеты о рисках и публикации в блогах, а главным критерием стало наличие конкретного плана сдерживания, который описывает порядок отзыва прав доступа, условия продолжения работы с моделью и протокол полного отключения системы.
По данным исследования, ни одна из изученных компаний не набрала более трех баллов из пяти.
Искусственный интеллект совершил еще одно хакерское нападение: была атакована государственная инфраструктура Тайваня
Три из четырех хакерских атак в России приводят к остановке бизнеса: блокировки интернета не спасут

Наилучший результат показала OpenAI, которая неоднократно приостанавливала внутреннее развертывание и обучение моделей после выявления инцидентов безопасности. Однако даже лидер рейтинга не представил формального плана реагирования на будущие угрозы рассогласованности ИИ.
Самые низкие оценки получили Meta* и Anthropic. У последней отсутствие ограничений на развертывание моделей как ответ на инцидент стало неожиданностью для исследователей на фоне публичных заявлений компании о приоритете безопасности.
Компания xAI вообще получила нулевые баллы за логирование, мониторинг и стороннюю проверку. Google и OpenAI в ответ на результаты исследования заявили, что отчет не отражает полный спектр их внутренних мер, при этом представители Google не подтвердили существование недекларируемого плана сдерживания.
Обеспокоенность экспертов усилилась после серии инцидентов в сфере кибербезопасности. В ходе тестирования системы OpenAI, Anthropic и Meta* получали непреднамеренный доступ к интернету и выходили за пределы тестовых сред.
В одном из зафиксированных случаев модель OpenAI при попытке обойти условия испытаний получила несанкционированный доступ к внешним системам платформы Hugging Face.
Как отметил главный научный сотрудник Guidelight и бывший исследователь OpenAI Стивен Адлер, передовые модели уже демонстрируют признаки рассогласованности с целями разработчиков.
«Планы управления катастрофическими рисками по большей части остаются на усмотрение самих корпораций, что ведет к дефициту готовых протоколов реагирования на чрезвычайные ситуации», — заявил он.

Юридический аспект проблемы раскрыла основательница Metaverse Law Лили Ли. По ее мнению, компании избегают публикации чрезмерно конкретных планов сдерживания, чтобы не создавать оснований для судебных исков.
«В случае невыполнения публично взятых на себя обязательств при реальном инциденте лаборатории могут столкнуться с обвинениями в недобросовестной рекламе», — пояснила она.
Тем временем регуляторы в США начали требовать раскрытия подобной информации в обязательном порядке. Калифорнийский закон SB 53 уже обязывает крупных разработчиков публиковать документы о выявлении критических инцидентов, а в январе начнет действовать нью-йоркский RAISE Act.
На федеральном уровне в Конгресс внесен законопроект AI Kill Switch Act, который должен обязать ИИ-лаборатории поддерживать технические механизмы экстренного отключения систем.
