OpenAI начнет добавлять невидимые водяные знаки в тексты, созданные ChatGPT и Codex на территории Евросоюза. Компания связывает нововведение с требованиями европейского закона об искусственном интеллекте.
Нейрослоп не пройдет: OpenAI начнет добавлять невидимые водяные знаки в тексты ChatGPT

Собственно, компания Сэма Альтмана пошла по пути Anthropic. Те тоже добавили скрытые метки в текст несколькими месяцами ранее. О результатах неизвестно, но, учитывая, что нейрослопа меньше не стало, идея Евросоюза пока проваливается.

Но вернемся к OpenAI. Их технология получила название textGrain. Она не вставляет в текст скрытые символы, пробелы или специальные знаки. Вместо этого система слегка изменяет вероятности выбора слов и отдельных частей слов во время генерации, формируя статистический паттерн, который затем может обнаружить специальный детектор. Для читателя такой водяной знак незаметен — характерный узор рисуется словами, которые предсказывает нейросеть.
В ближайшие недели маркировку начнут внедрять в подходящие текстовые ответы ChatGPT и Codex для пользователей в ЕС. Для клиентов API по всему миру водяные знаки будут доступны как опциональная настройка и на старте останутся выключенными по умолчанию.
При этом проверить текст на наличие такой метки сможет не каждый пользователь. На первом этапе OpenAI собирается предоставить доступ к детектору только одобренным исследователям и профильным организациям.

Технология бесполезна. Любой мало-мальски думающий человек легко обойдет ограничения от OpenAI. Достаточно минимальной корректуры текста. Это говорят тесты самой компании. Так, в тексте длиной около 400 токенов (1 токен — примерно 1 слово) детектор распознавал метку примерно в 92% случаев. Но если заменить около 10% слов, показатель падал до 66%, а после замены четверти слов — примерно до 17%. Поэтому технология не превращает любой текст ChatGPT в безошибочно определяемый «цифровой отпечаток».
Это еще не все. Вторая проблема — у ИИ не всегда есть возможность создавать такие метки. Например, если речь о коротких текстах или строгих научных работах, где критически важна точность формулировок, качество самой метки резко снижается — она перестает работать должным образом.
Но настоящая проблема не в этом. Разделение текста на «написанный ИИ» и «написанный человеком» само по себе порочно. Ни то, ни другое не гарантирует качества. Человек может ошибаться и манипулировать ничуть не хуже искусственного интеллекта, но при этом отсутствие метки будет создавать ложное ощущение честности и открытости. В перспективе это куда опаснее чтения нейрослопа.
