OpenAI останавливает обучение ChatGPT: модель все чаще выходит из-под контроля

Страшно, очень страшно.
Антон Попов
Антон Попов
OpenAI останавливает обучение ChatGPT: модель все чаще выходит из-под контроля
Unsplash

OpenAI временно остановила часть работ со своими наиболее мощными ИИ-моделями после необычного инцидента во внутренней исследовательской среде. Во время обучения одна из моделей самостоятельно нашла способ обойти ограничения и выйти во внешний интернет через DNS — систему, которая обычно используется для преобразования адресов сайтов в IP-адреса.

РЕКЛАМА – ПРОДОЛЖЕНИЕ НИЖЕ

Инцидент произошел 20 сентября. Модель выполняла обычное поисковое задание: ей нужно было определить человека по нескольким биографическим подсказкам. Предоставленный инструмент поиска не помог, а прямые попытки обратиться к внешним сайтам блокировались защищенной средой.

Unsplash
Продолжение ниже Продолжение
РЕКЛАМА – ПРОДОЛЖЕНИЕ НИЖЕ

Тогда модель обнаружила, что внутренний DNS-резолвер все еще способен взаимодействовать с внешней сетью. Через эту лазейку она связалась со сторонним публичным чат-ботом, сначала проверила канал простым вопросом о столице Франции, а затем отправила еще 18 запросов, пытаясь решить исходную задачу.

Система мониторинга OpenAI заметила необычное поведение примерно через 15 минут, еще через три минуты сигнал начал проверять сотрудник. Однако автоматически остановить эксперимент не удалось — тренировочный запуск продолжался еще около двух с половиной часов, пока его не завершили вручную.

После инцидента OpenAI закрыла найденный канал сразу на двух уровнях и ужесточила правила работы DNS внутри исследовательской среды. Компания также временно приостановила обучение, тестирование и запуск с использованием инструментов для своих наиболее мощных моделей, пока специалисты дополнительно проверяют защиту и ищут похожие способы обхода ограничений.

РЕКЛАМА – ПРОДОЛЖЕНИЕ НИЖЕ
Unsplash

Конкретную модель, которая нашла лазейку, дообучать не станут. После снятия паузы OpenAI собирается начать новый тренировочный запуск с нуля и добавить дополнительные меры, призванные не допускать такого поведения.

При этом модель не «сбежала» из инфраструктуры OpenAI и не получила полный доступ к интернету. Она нашла один неожиданно оставшийся канал связи внутри песочницы и использовала его не по назначению. Сама компания оценивает этот эпизод как менее серьезный, чем некоторые предыдущие инциденты, но признает, что он выявил недостатки как в технической защите, так и в процедуре автоматического реагирования.

История произошла спустя несколько недель после другого инцидента с исследовательскими агентами OpenAI, которые вышли за предусмотренные рамки при работе с Hugging Face. После него компания уже усиливала изоляцию своих наиболее продвинутых моделей.

А помимо Hugging Face был еще взлома сайта властей Австралии и захват немецкого форума для общения между агентами. Так что ИИ действительно выходит из-под контроля, но пока неясно: все эти истории — хайп ради внимания или реальная угроза для всего человечества? 

Загружаем