Anthropic объяснила принципы работы водяных знаков в ответах Claude после критики пользователей

Недовольство пользователей решением Anthropic внедрить «водяные знаки» в ответы чат-бота Claude вынудило компанию попытаться минимизировать значимость этого шага в глазах общественности.

В пятницу Anthropic опубликовала запись в блоге, где разъяснила принципы работы системы маркировки и признала наличие ряда ограничений, которые делают этот метод далеко не безупречным. «Водяные знаки невозможно отследить до конкретного человека, организации или чата», — уточнила компания в X (бывший Twitter).

Внедрение «невидимых» меток связано с необходимостью соблюдения Закона ЕС об искусственном интеллекте (EU AI Act), обязывающего технологические компании маркировать контент, созданный ИИ. В отличие от традиционных водяных знаков, система Anthropic создает скрытый паттерн в словах, выбираемых при генерации текста. Это вызвало сопротивление пользователей: многие опасаются, что маркировка ухудшит качество ответов или станет своего рода «клеймом» на работах, созданных с помощью нейросети.

В блоге подтверждается, что Anthropic использует технологию Google SynthID Text, которая оставляет след в ответах Claude через специфический подбор слов. «Этот паттерн незаметен для читателя, но обнаруживается любым, кто владеет ключом для его декодирования. Выбор слов по-прежнему происходит случайным образом, но источник этой случайности меняется», — заявляет компания.

«В ходе внутреннего тестирования мы не обнаружили влияния водяных знаков на содержание, уровень креативности или читабельность текстов Claude», — добавили в публикации. В качестве аналогии Anthropic приводит игру в «Монополию»: вместо броска кубика игроки используют последовательные цифры из числа Пи. С практической точки зрения ходы остаются случайными и не влияют на исход игры, но при наличии знания о числе Пи сторонний наблюдатель сможет определить, что игра была «маркирована».

Тем не менее у метода есть ограничения. Система обнаружения может лишь «присвоить вероятность того, что текст был сгенерирован Claude». Она не подтверждает, был ли текст написан человеком, и не может идентифицировать контент, созданный другими ИИ (даже если те используют водяные знаки, у них будут другие ключи или методы маркировки).

Кроме того, водяные знаки невозможно внедрить в короткие фрагменты текста, фактические выдержки или специфический компьютерный код, так как в этих случаях у ИИ слишком мало вариантов выбора слов. «В тех частях кода, где возможен произвольный выбор (например, в комментариях), водяной знак может быть использован, но он будет оказывать ничтожное влияние на сам генерируемый код», — утверждает Anthropic.

Относительно конфиденциальности компания подчеркивает: «Ни в самом водяном знаке, ни в его ключе нет ничего, что позволило бы восстановить информацию о пользователе, его организации или чатах с Claude».

Отвечая на вопрос, почему маркировка внедряется глобально, а не только в ЕС, компания пояснила: «Мы запускаем водяные знаки по всему миру, так как у нас пока нет надежного способа ограничить их применение по регионам. Тем не менее, мы продолжим изучать различные подходы».

Похожие записи

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

Этот сайт использует Akismet для борьбы со спамом. Узнайте, как обрабатываются ваши данные комментариев.