Мы обречены? Оказалось, у ИИ-компаний нет плана на случай выхода нейросетей из-под контроля

Проверили пять ведущих ИИ-лабораторий на готовность к потере контроля над моделями, и ни одна из них не набрала больше трех баллов из пяти.
Игорь Барышев
Игорь Барышев
Мы обречены? Оказалось, у ИИ-компаний нет плана на случай выхода нейросетей из-под контроля
Magnific

Большинство ведущих разработчиков искусственного интеллекта не опубликовали протоколы действий на случай, если их модели попытаются обойти контроль человека.

РЕКЛАМА – ПРОДОЛЖЕНИЕ НИЖЕ

К такому выводу пришла организация Guidelight AI Standards в ходе исследования готовности пяти крупнейших лабораторий — Anthropic, Google, OpenAI, Meta* (организация признана экстремистской, ее деятельность запрещена на территории Российской Федерации) и xAI — к критическим сценариям.

Аналитики изучили все доступные материалы: системные карты, фреймворки безопасности, отчеты о рисках и публикации в блогах, а главным критерием стало наличие конкретного плана сдерживания, который описывает порядок отзыва прав доступа, условия продолжения работы с моделью и протокол полного отключения системы.

По данным исследования, ни одна из изученных компаний не набрала более трех баллов из пяти.

Magnific
Продолжение ниже Продолжение
РЕКЛАМА – ПРОДОЛЖЕНИЕ НИЖЕ

Наилучший результат показала OpenAI, которая неоднократно приостанавливала внутреннее развертывание и обучение моделей после выявления инцидентов безопасности. Однако даже лидер рейтинга не представил формального плана реагирования на будущие угрозы рассогласованности ИИ.

Самые низкие оценки получили Meta* и Anthropic. У последней отсутствие ограничений на развертывание моделей как ответ на инцидент стало неожиданностью для исследователей на фоне публичных заявлений компании о приоритете безопасности.

Компания xAI вообще получила нулевые баллы за логирование, мониторинг и стороннюю проверку. Google и OpenAI в ответ на результаты исследования заявили, что отчет не отражает полный спектр их внутренних мер, при этом представители Google не подтвердили существование недекларируемого плана сдерживания.

РЕКЛАМА – ПРОДОЛЖЕНИЕ НИЖЕ

Обеспокоенность экспертов усилилась после серии инцидентов в сфере кибербезопасности. В ходе тестирования системы OpenAI, Anthropic и Meta* получали непреднамеренный доступ к интернету и выходили за пределы тестовых сред.

В одном из зафиксированных случаев модель OpenAI при попытке обойти условия испытаний получила несанкционированный доступ к внешним системам платформы Hugging Face.

Как отметил главный научный сотрудник Guidelight и бывший исследователь OpenAI Стивен Адлер, передовые модели уже демонстрируют признаки рассогласованности с целями разработчиков.

РЕКЛАМА – ПРОДОЛЖЕНИЕ НИЖЕ

«Планы управления катастрофическими рисками по большей части остаются на усмотрение самих корпораций, что ведет к дефициту готовых протоколов реагирования на чрезвычайные ситуации», — заявил он.

Magnific

Юридический аспект проблемы раскрыла основательница Metaverse Law Лили Ли. По ее мнению, компании избегают публикации чрезмерно конкретных планов сдерживания, чтобы не создавать оснований для судебных исков.

«В случае невыполнения публично взятых на себя обязательств при реальном инциденте лаборатории могут столкнуться с обвинениями в недобросовестной рекламе», — пояснила она.

Тем временем регуляторы в США начали требовать раскрытия подобной информации в обязательном порядке. Калифорнийский закон SB 53 уже обязывает крупных разработчиков публиковать документы о выявлении критических инцидентов, а в январе начнет действовать нью-йоркский RAISE Act.

На федеральном уровне в Конгресс внесен законопроект AI Kill Switch Act, который должен обязать ИИ-лаборатории поддерживать технические механизмы экстренного отключения систем.

Загружаем