Anthropic объяснила принципы работы водяных знаков в ответах Claude после критики пользователей
Недовольство пользователей решением Anthropic внедрить «водяные знаки» в ответы чат-бота Claude вынудило компанию попытаться минимизировать значимость этого шага в глазах общественности.
В пятницу Anthropic опубликовала запись в блоге, где разъяснила принципы работы системы маркировки и признала наличие ряда ограничений, которые делают этот метод далеко не безупречным. «Водяные знаки невозможно отследить до конкретного человека, организации или чата», — уточнила компания в X (бывший Twitter).
Внедрение «невидимых» меток связано с необходимостью соблюдения Закона ЕС об искусственном интеллекте (EU AI Act), обязывающего технологические компании маркировать контент, созданный ИИ. В отличие от традиционных водяных знаков, система Anthropic создает скрытый паттерн в словах, выбираемых при генерации текста. Это вызвало сопротивление пользователей: многие опасаются, что маркировка ухудшит качество ответов или станет своего рода «клеймом» на работах, созданных с помощью нейросети.
В блоге подтверждается, что Anthropic использует технологию Google SynthID Text, которая оставляет след в ответах Claude через специфический подбор слов. «Этот паттерн незаметен для читателя, но обнаруживается любым, кто владеет ключом для его декодирования. Выбор слов по-прежнему происходит случайным образом, но источник этой случайности меняется», — заявляет компания.
«В ходе внутреннего тестирования мы не обнаружили влияния водяных знаков на содержание, уровень креативности или читабельность текстов Claude», — добавили в публикации. В качестве аналогии Anthropic приводит игру в «Монополию»: вместо броска кубика игроки используют последовательные цифры из числа Пи. С практической точки зрения ходы остаются случайными и не влияют на исход игры, но при наличии знания о числе Пи сторонний наблюдатель сможет определить, что игра была «маркирована».
Тем не менее у метода есть ограничения. Система обнаружения может лишь «присвоить вероятность того, что текст был сгенерирован Claude». Она не подтверждает, был ли текст написан человеком, и не может идентифицировать контент, созданный другими ИИ (даже если те используют водяные знаки, у них будут другие ключи или методы маркировки).
Кроме того, водяные знаки невозможно внедрить в короткие фрагменты текста, фактические выдержки или специфический компьютерный код, так как в этих случаях у ИИ слишком мало вариантов выбора слов. «В тех частях кода, где возможен произвольный выбор (например, в комментариях), водяной знак может быть использован, но он будет оказывать ничтожное влияние на сам генерируемый код», — утверждает Anthropic.
Относительно конфиденциальности компания подчеркивает: «Ни в самом водяном знаке, ни в его ключе нет ничего, что позволило бы восстановить информацию о пользователе, его организации или чатах с Claude».
Отвечая на вопрос, почему маркировка внедряется глобально, а не только в ЕС, компания пояснила: «Мы запускаем водяные знаки по всему миру, так как у нас пока нет надежного способа ограничить их применение по регионам. Тем не менее, мы продолжим изучать различные подходы».

Добавить комментарий