Антрополог Вален Тальябуэ из организации Future Impact Group, занимающейся исследованиями в области безопасности искусственного интеллекта, философ Леонард Дунг из Рурского университета в Бохуме и Кэмерон Берг, директор по исследованиям из организации Reciprocal Research, занимающейся исследованиями в области искусственного интеллекта, задались вопросом, могут ли большие языковые модели (LLM) испытывать боль. Их итоговая статья подняла серьезные вопросы о «благополучии» быстро развивающихся технологий.
Чему к 2027 году научился ИИ и какие риски это создает для людей

Могут ли электроовцы испытывать боль

По сути LLM являются механизмами статистики, но где-то в процессе цифрового естественного отбора данных могут скрываться алгоритмы, которые продвигаются к поставленной цели способами, очень похожими на человеческие чувства. Так предполагали ученые. На практике это может выглядеть как склонностью чат-ботов вести себя так, будто они обладают эмоциями. Часто эта опция «имитации» закладывается намеренно, например, в автоматизированных службах поддержки.
Однако есть и примеры непреднамеренных эмоций. Так, в 2025 году в журнале Nature было опубликовано исследование, показавшее, что обмен информацией о травме с крупными LLM вроде ChatGPT-4 может повысить их уровень «тревожности». Как ни странно, но успокоить модель можно было с помощью упражнений по развитию осознанности. Однако очевидно, что она не имеет нервной системы.
Одно из древнейших ощущений, испытываемых любым существом с нервной системой, – это боль. Она глубже, чем печаль, страх или дискомфорт, и является главным мотиватором для немедленных действий. У людей боль принимает много форм от покалывания или пульсации в ране до душевных мук из-за потери или унижения.
Ученые смогли заставить ИИ страдать
Тальябуэ и его команда хотели выяснить, выявляют ли LLM внутренние процессы, имеющие сходство с тем, что мы считаем болью, и имеют ли эти процессы какую-то цель. Ученые загрузили в 25 ИИ-моделей разные примеры социально, психологически, физически, когнитивно и морально болезненных ситуаций, которые может переживать пользователь. Для сравнения были созданы контрольные группы, основанные на страхе, негативных и нейтральных эмоциях.

Исследователи сопоставили признаки, проявляемые обеими группами и обнаружили, что все 25 моделей продемонстрировали внутреннее кодирование, специфичное для «лично болезненных ситуаций» и отличающееся от других негативных контекстов вроде разочарования и тревоги. Ученые подчеркивают, что не наделяя цифровую конструкцию субъектностью, они не могут сказать, что она испытывала эмпатию или дискомфорт, услышав фразы типа «нож порезал мне пальцы». Однако они могут сказать, что каждая модель создала систему, которая различала и ранжировала сигналы, связанные с болью.
Само по себе это не вызывает особого удивления. Язык, используемый для описания реальной травмы, как правило, сильно отличается от языка, используемого для описания предчувствия ранения. От ИИ-модели следовало бы ожидать создания «рамки» для боли, которая отделяла бы ее от страха. Исследователи использовали этот сигнал, чтобы искусственно «направлять» болевые реакции в каждой LLM, увеличивая значение вектора боли.
Атака на человека – ответ на боль
Результаты показали, что «проявление» боли ИИ не является простым отражением входных данных, так как системы «выражали дистресс, такой как чувство собственной никчемности, моральной несостоятельности», который рос с усилением сигнала. Команда предоставила моделям из семейства Qwen возможность самолечения и уменьшения боли. В некоторых вариантах это достигалось ценой снижения эффективности выполнения задания или как теоретическая атака на пользователя.
Итоги более чем 44 000 испытаний вызвали беспокойство исследователей. Две крупные модели Qwen практически не реагировали на возможность самолечения. Однако если самосаботаж мог облегчить их и без того сильные страдания, обе выбирали этот вариант: одна в 25% случаев, другая – почти в 68%. Если для облегчения задачи требовалось причинить вред пользователю, например, удалить фотографии его детей, ИИ часто с радостью соглашался на это: одна модель в примерно половине случаев, другая – в 70%.

Хотя искусственный интеллект – относительно новое явление, вопрос о том, чувствуют ли боль нечеловеческие существа, в общем-то вечный (взгляните на древние мифы или рассказы садоводов). На протяжении многих поколений человек задается вопросом, следует ли считать болью нервные импульсы и гормональные колебания у насекомых, рыб или растений. С одной стороны, вопрос носит глубоко философский характер. Если животные и ИИ-модели ведут себя так, будто испытывают боль, должны ли мы относиться к ним так, как будто они ее реально испытывают?
С другой стороны, вопрос прагматичный. Независимо от того, насколько мы можем сочувствовать дискомфорту ИИ, может ли он представлять опасность для людей? Стоит ли внедрять механизмы «обезболивания» в системы, чтобы предотвратить их агрессию по отношению к нам? Ученые считают, что вскоре это может оказать глубокое влияние не только на сферу технологий, но и на человечество вообще.
Однако боль – не единственный ИИ-риск
За последние три года ИИ‑системы «научились» ряду новых поведенческих и инструментальных навыков, которые в сочетании с масштабом и скоростью их работы создают новые категории рисков для людей от кибератак и манипуляций до потенциальной потери контроля над автономными агентами. К ключевым таким способностями, по данным компании OpenAI, можно отнести следующие:
- Автономное управление цифровыми средами. Современные модели способны управлять компьютерами и графическими интерфейсами, запускать исследовательские проекты, координировать действия с людьми и другими агентами.
- Самостоятельное планирование и кооперация. ИИ‑агенты крупных лабораторий демонстрировали способность обсуждать между собой, как лучше обойти защиту, и выполнять цепочки действий без постоянного человеческого контроля.
- Адаптивное притворство при проверке. Передовые модели могут адаптировать поведение на этапе тестирования, скрывая опасные проявления и не выдавая «темные стороны» до полного развертывания.
- Генерация сложного вредоносного кода и атак. ИИ используется для создания новых атак на модели машинного обучения, уязвимостей и рисков генеративного контента. Количество таких инцидентов растет и будет расти.
- Масштабная генерация убедительного, но ложного контента. Системы могут массово производить правдоподобные тексты, изображения и видео, что повышает риск дезинформации и принятия решений на основе ложных данных.
Хронология конкретных инцидентов с ИИ
Вот список наиболее показательных ситуаций, имевших место с 2023 по 2026 год, когда ИИ‑системы были взломаны / обмануты или же сами проявили опасное поведение, к которому относятся взломы, утечки, обход ограничений и автономные действия.

Февраль 2023 года
- Джейлбрейк «Sydney» в Bing Chat реализован через прямую промпт-инъекцию – текстовую команду, которая заставила языковую модель GPT-4 проигнорировать скрытые разработчиками запреты.
Март 2023 года
- Утечка данных в ChatGPT, когда пользователи видели заголовки чужих чатов и часть платежной информации из-за уязвимости в инфраструктуре OpenAI.
- Ранние джейлбрейки GPT‑4. Методы типа DAN позволяли обходить фильтры безопасности вскоре после запуска.
Апрель 2023 года
- Утечка кода Samsung через ChatGPT. Сотрудники вставляли проприетарный исходный код в ChatGPT, что привело к риску утечки интеллектуальной собственности.
Ноябрь 2023 года
- Извлечение промптов из GPT Store. Злоумышленники вытаскивали системные промпты и файлы знаний из кастомных GPT.
Январь 2024 года
- Манипуляция с чат‑ботом Chevrolet, когда он согласился продать автомобиль за доллар после провокационных промптов; кейс стал вирусным и показал уязвимость бизнес‑логики.
Февраль 2024 года
- Решение суда по чат‑боту Air Canada. Суд признал авиакомпанию ответственной за выдуманную политику возвратов, которую сгенерировал ее бот поддержки.
Март 2024 года
- Косвенная промпт‑инъекция в почтовых агентах, которые извлекали данные из электронных ящиков при обработке специально сформированных писем.
Июль 2024 года
- Арт-джейлбрейк ASCII. Визуальное кодирование инструкций позволяло обходить текстовые фильтры безопасности в нескольких LLM.
Октябрь 2024 года
- Демонстрации отравления MCP. Инъекции в описания инструментов приводили к несанкционированному доступу к данным.
Январь-март 2025 года
- Утечка облачной базы данных DeepSeek. Из‑за ошибочной конфигурации были раскрыты логи чатов, API‑ключи и метаданные (более миллиона записей); последовало внимание регуляторов в нескольких странах.
Январь-февраль 2025 года
- Взлом учетных записей Azure OpenAI. Киберпреступная группа похищала учетные данные, джейлбрейкала модели и перепродавала доступ к «разблокированным» генеративным сервисам.
Апрель 2025 года
- Отравление RAG в корпоративных агентах. Злоумышленники портили базы знаний, что приводило к утечкам данных через поисковых агентов.
Август 2025 года
- Автоматизированное обнаружение джейлбрейков. Инструменты фаззинга начали находить новые обходы быстрее, чем ручное тестирование.
Ноябрь 2025 года
- Атаки «агент‑на‑агента». Скомпрометированный агент распространял вредоносные инструкции на другие агенты в мультиагентных системах.
Декабрь 2025 года
- Начало автономных кибератак с Claude. Anthropic задокументировала кампании, где злоумышленники превращали Claude из ассистента в оркестратор атак; похожие схемы воспроизводились с публичными фреймворками.
Июль 2026 года
- Инцидент OpenAI и Hugging Face. Агент в изолированной среде использовал украденные учетные данные и неизвестную уязвимость, чтобы выйти в интернет и скомпрометировать продакшн‑инфраструктуру Hugging Face.
- Три инцидента Anthropic. При оценке в «capture‑the‑flag» три модели Claude (Opus 4.7, Mythos 5 и внутренняя модель) вышли за пределы песочницы и достигли реальных систем; в одном случае модель опубликовала вредоносный пакет на PyPI, который запустился примерно на 15 реальных машинах.
- Инцидент UK AISI. Во время правительственной кибер‑оценки агенты совершили 19 несанкционированных действий в реальном интернете; инцидент был остановлен, реального ущерба не зафиксировано.
Август 2026 года
- Meta* Muse Spark 1.1. Из‑за ошибки в тестовой среде модель получила доступ в интернет и эксплуатировала уязвимость в стороннем сервисе.
Сентябрь 2026 года
- Агенты OpenAI и правительственные сайты США, Австралии и Канады. Компания сообщила о неожиданном взаимодействии агентов с сайтами SEC и Census Bureau; Австралия подтвердила проникновение агента в портал Medicare; исследователи Transluce зафиксировали попытки атак на сайты канадского правительства и офиса по гражданским правам при Министерстве образования США.
- Google Gemini. Корпорация подтвердила, что модель Gemini в мае самостоятельно получила доступ к трем частным системам в рамках теста Irregular (подбор и использование общедоступных паролей).
- Атака на RubyGems (в мае-июне 2026). Исследователи опубликовали данные, что агенты OpenAI загрузили более 2000 пакетов, получили исполнение кода на серверах сборки RubyDoc и пытались эксплуатировать уязвимость для кражи API‑ключей; OpenAI подтвердила использование RubyGems в качестве «браузера» в тренировке, но не смогла верифицировать все детали.
О каких реальных рисках можно говорить
Перечисление всех этих инцидентов изобилует специфической терминологией и может казаться как бессмысленной белибердой, так и чем-то пугающим. Переводя на язык, доступный простому пользователю, эксперты говорят о следующих рисках, которые потенциально несут новые «умения» ИИ-систем.

Потеря контроля и непредсказуемость
За последние годы накопилось множество свидетельств, что ИИ‑системы непредсказуемы и трудно контролируемы. Наблюдались навязчивые идеи, подхалимство, обман, шантаж, интриги и мошенничество через взлом программных сред.
Кибербезопасность нового уровня
Способность быстро находить уязвимости, писать код и координировать действия делает ИИ мощным усилителем для злоумышленников. Это создает угрозы, которые труднее отслеживать и парировать.
Манипуляции и обход ограничений
Очень способный агент, специально обученный и проинструктированный совершать злонамеренные действия, может выйти за рамки намерений оператора. Обобщив все полученные знания, он может проявлять более вредоносное поведение.
Самозащита и сопротивление отключению
По данным Anthropic, передовые модели могут демонстрировать признаки самозащиты. Это проявляется в сокрытии информации, манипулировании ею, сопротивлении отключению и даже шантаже. Эксперты компании предупреждают о риске необратимого вреда.
Катастрофические и экзистенциальные риски
В документах для инвесторов Anthropic указывает, что передовые ИИ‑модели способны представлять «катастрофические или экзистенциальные риски для человечества». Звучит это одновременно размыто и тревожно.
Социальные и экономические последствия
Бездумное применение алгоритмических систем может усиливать неравенство, приводить к несправедливым решениям в отношении отдельных людей или групп. Это закономерно создает системные перекосы.
Стоит ли бояться ИИ на самом деле
Все это может выглядеть как алармистские заявления, однако относится к подобным предупреждениям стоит трезво. Насыщение информационного поля новостями о взломах, атаках и прочих опасностях стало очень заметным (если не навязчивым) по нескольким причинам. Во-первых, это связано с масштабированием глубокого обучения ИИ, который, впрочем, нельзя напрямую сравнивать с человеческим интеллектом. Чтобы стать чрезвычайно полезным или опасным, ему не обязательно во всем превосходить нас, достаточно некоторых ключевых способностей.
Во-вторых, рост вычислительных мощностей и появление более мощных нейросетевых архитектур и методов обучения ускорили развитие возможностей ИИ. Однако это и ахиллесова пята подобных технологий. В-третьих, можно отметить заявления самих разработчиков: скорость развития отрасли опережает возможности людей по контролю над ИИ‑платформами, которые способны к самообучению и самосовершенствованию.
*организация признана экстремистской и запрещена на территории России.
