Как будет работать водяной знак в текстах Claude? Компания реализовала очень элегантное решение

Такое решение не позволяет точно определять авторство текста.
Антон Попов
Антон Попов
Как будет работать водяной знак в текстах Claude? Компания реализовала очень элегантное решение
Unsplash

Несколько дней назад компания Anthropic — ключевые разработчики в сфере искусственного интеллекта, внедрили водяные знаки в код и текст, которые генерируют их модели. Решение было принято из-за давления стран ЕС, но как система водяных знаков была реализована?

Когда новость о внедрении водяных знаков только появилась, мы писали, что есть несколько способов, которые могли бы внедрить разработчики. Но самый оптимальный — скорректировать способ генерации текста, чтобы модель подставляла определенные слова. Тогда сам текст станет гигантским водяным знаком, так как определенная последовательность слов будет говорить об авторстве куда лучше зашитых скрытых символов. 

Unsplash
РЕКЛАМА – ПРОДОЛЖЕНИЕ НИЖЕ
РЕКЛАМА – ПРОДОЛЖЕНИЕ НИЖЕ

Сегодня Anthropic рассказала, каким образом будет осуществляться детекция ИИ-текста. Мы попали в точку: никаких скрытых символов, только особенности генерации. Объясняем на пальцах, как будет работать новая система.

Claude формирует текст последовательно, каждый раз выбирая следующий токен из нескольких возможных вариантов. Например, после фразы «погода сегодня была холодной и...» модель может продолжить ее словами «пасмурной» или «серой». Для смысла предложения разница невелика, поэтому такие выборы можно использовать для маркировки текста.

Anthropic меняет не сам набор доступных слов, а способ, которым Claude выбирает между ними. Вместо обычного генератора случайных чисел используется алгоритм, связанный с секретным ключом и несколькими предыдущими словами. Имея этот ключ, система проверки может определить, насколько последовательность слов соответствует характерному для Claude способу генерации.

Продолжение ниже Продолжение
Unsplash

Для читателя текст с маркировкой ничем не отличается от обычного: в него не добавляются специальные символы или скрытые элементы. Водяной знак также не требует дополнительных токенов, поэтому, по заявлению компании, не увеличивает время и стоимость генерации.

Но есть и минусы: отличить ИИ-текст от написанного человеком с гарантированной точностью все еще нельзя. Речь идет о вероятностях, а не фактическом использовании моделей. Также легко обойти ограничения. Достаточно переписать пару абзацев, дописать несколько от себя и вот уже текст не отличим от человеческого для алгоритмов. 

Так что все нововведения Anthropic — фикция. Способов надежно отличать настоящий текст от сгенерированного, как не было так и нет. Поэтому не стоит стесняться использования ИИ, но только разумного. Любой сгенерированный текст требует строгой проверки фактов и качественной редактуры. А иначе получится скучный слоп, который не вызывает никаких эмоций.

Загружаем