
Фото до статті
Дмитро Сімагін
Редактор
Кілька днів тому Anthropic повідомила, що майбутні версії Claude будуть створювати текст із вмонтованим водяним знаком. Зараз компанія вирішила детально пояснити механізм роботи цього нововведення. Передбачається, що водяний знак дозволить ідентифікувати ймовірність того, що текст було створено за допомогою Claude.

Суть нового методу маркування полягає в тому, що мовні системи, подібні до Claude, формують текст послідовно, слово за словом, щоразу обираючи наступне слово з набору імовірних варіантів. У фразі «Погода сьогодні була прохолодна і…» наступним словом навряд чи буде «цукерка», але цілком імовірно — «хмарна» чи «похмура». У випадках, коли кілька варіантів є приблизно рівнозначними за значенням, вибір часто визначається випадковим числом.
Водяний знак використовує саме такі «малоризиковані» моменти вибору — яких у будь-якому згенерованому тексті є багато — для того, щоб залишити у відповідях Claude ледь помітний для читача візерунок. Розшифрувати цю послідовність слів можливо лише за наявності спеціального ключа.
Технічно вибір слів залишається випадковим, але джерелом цієї випадковості стає не довільний генератор чисел, а комбінація ключа та кількох попередніх слів. Це дає змогу перевірити, чи відповідає послідовність слів у тексті вибору, який зробив би Claude, використовуючи цей ключ, і на основі цього визначити ймовірність генерації тексту саме цією моделлю.
Важливо: водяний знак не змушує модель вибирати одне й те саме слово постійно (наприклад, завжди «хмарна», а не «похмура») — вибір, як і раніше, залежить від контексту. І він не спонукає Claude до слів, які модель за звичайних умов навіть не розглядала б.
Чи впливає це на якість тексту?
Згідно з даними Anthropic, водяний знак жодним чином не позначається на якості, креативності чи читабельності текстів Claude. Для читача текст із водяним знаком нічим не відрізняється від звичайного — на відміну від видимих неозброєним оком водяних знаків на банкнотах чи документах.
Компанія посилається на дослідження Google DeepMind, представлене у статті про метод SynthID-Text у журналі Nature — саме на цьому методі ґрунтується підхід Anthropic. Під час тестування водяних знаків на частині трафіку Gemini, DeepMind не виявили статистично значущої різниці в оцінках користувачів («лайки» проти «дизлайків») між моделями з водяним знаком та без нього. Контрольоване дослідження за участю людей-оцінювачів також не показало відмінностей у якості відповідей.
Anthropic пропонує таку аналогію: уявіть гру в «Монополію», де замість кидання кубика гравці по черзі використовують цифри з числа пі. Результат для гри залишається однаково випадковим — але якщо потім проаналізувати всю послідовність ходів, маючи значення пі, можна встановити, що саме воно було джерелом випадковості. Так само функціонує водяний знак у тексті: він не змінює сенсу чи сприйняття тексту читачем, але дозволяє згодом перевірити, чи брав участь у його створенні Claude.
Обмеження методу
У Anthropic наголошують: водяний знак може лише надати відповідь на питання «яка ймовірність, що цей текст частково написав Claude». Він не підтверджує, що текст створений людиною, і не може визначити, чи його створив інший штучний інтелект (навіть якщо той також використовує водяні знаки — ключ і метод будуть відмінними).
Метод погано функціонує на коротких фрагментах тексту — там менше можливостей для вибору слів, а отже, менше «сигналу». Чим довший текст, тим вища впевненість у результаті перевірки.
Водяний знак також слабше виражений у фактологічних текстах, де варіативність слів мінімальна: наприклад, у реченні «Найвідоміша праця Ісаака Ньютона називалася Principia…» немає простору для вибору — правильна відповідь лише одна. Те саме стосується редагування: якщо Claude лише виправляє граматичні та пунктуаційні помилки в чужому тексті, водяному знаку майже ні на чому «закріпитися».
А що з кодом і редагуванням чужих текстів?
Коли Claude редагує текст, написаний людиною, водяний знак застосовується лише до тих слів, які вибрав сам Claude. Якщо правки незначні, виявити водяний знак може бути складно або неможливо — просто через брак «матеріалу».
З кодом ситуація схожа: там, де потрібне точне, єдино правильне рішення (наприклад, «2 + 2 =» точно завершується «4»), водяний знак не використовується — адже вибору між рівнозначними варіантами тут немає. Тому код загалом має суттєво менше водяного маркування, ніж звичайний текст, хоча в довільних елементах — наприклад, у коментарях до коду — водяний знак все ж може бути присутнім.
Практичні питання щодо водяних знаків Claude
Чи сповільнює це роботу моделі або підвищує вартість? Ні — водяний знак не вимагає додаткових токенів і не впливає на швидкість генерації.
Чи можна відстежити знак до конкретного користувача чи організації? Ні. Водяний знак стосується лише моделі та її вихідних даних — він не містить жодної ідентифікуючої інформації про користувача, компанію чи конкретний чат.
Чому взагалі впроваджують водяні знаки? Причина — вимоги Кодексу належної практики ЄС щодо прозорості контенту, згенерованого ШІ (EU Code of Practice on Transparency of AI-Generated Content), який Anthropic підписала у липні 2026 року разом із приблизно 190 іншими організаціями. Водяне маркування впроваджується глобально одразу при запуску — оскільки на даний момент немає надійного способу обмежити його лише регіоном ЄС.
Як перевірити, чи текст написаний Claude? Anthropic найближчим часом планує запустити окремий API для виявлення водяних знаків.
А що з зображеннями та іншими файлами? Для підтримуваних форматів файлів (наприклад, .png, .jpg, .svg) Claude додаватиме криптографічно підписану мітку в метадані файлу за відкритим галузевим стандартом C2PA — тим самим, який використовують виробники камер і редактори фото. Це не водяний знак: файл не змінюється, мітка лише вказує на участь Claude у створенні чи обробці файлу.
Чи можна обійти водяний знак шляхом редагування тексту? Частково так. Незначне редагування, ймовірно, не видалить знак повністю, а повне переписування кожного слова — видалить.
Чи застосовується це до перекладів? Так — якщо кожне слово в перекладі обирає Claude, водяний знак застосовується повністю.
А старі моделі Claude? Закон ЄС передбачає перехідний період для моделей Anthropic, випущених до 2 серпня 2026 року — компанія працює над додаванням водяних знаків і для них, впровадження триватиме кілька місяців.
Чим це відрізняється від сервісів виявлення ШІ-тексту на кшталт Pangram? Такі сервіси не мають ключа Anthropic і покладаються на інший підхід — пошук характерних «слідів» у стилі ШІ (наприклад, конструкцію «це не X, це Y» або надмірне вживання певних слів). Це принципово інший метод, ніж перевірка водяного знака.
Чи змінює це права власності на текст або відповідальність за нього? Ні. Водяний знак лише допомагає перевірити, чи міг Claude брати участь у створенні контенту — він не стосується авторства чи прав власності і не змінює умов використання сервісу.
Нагадаємо, нещодавно стало відомо, що китайська компанія ByteDance розробляє гігантську LLM на 10 трлн параметрів, щоб наздогнати Claude.
Головна > Новини > Як працює водяний знак у текстах і коді Claude — пояснює Anthropic
