Компанія Anthropic у своєму блозі спробувала надати відповіді на ключові запитання стосовно того, як вона планує позначати згенерований її чат-ботом Claude текст водяними знаками. Зокрема, розглядається механізм роботи цих знаків, можливість їх видалення шляхом редагування, а також потенційний вплив на програмний код.

Компанія Anthropic у своєму блозі спробувала надати відповіді на ключові запитання стосовно того, як вона планує позначати згенерований її чат-ботом Claude текст водяними знаками. Зокрема, розглядається механізм роботи цих знаків, можливість їх видалення шляхом редагування, а також потенційний вплив на програмний код.
Користувачі Claude активно обговорюють це рішення з моменту оголошення минулого тижня про запровадження маркування водяними знаками. Цей крок зумовлений необхідністю відповідати вимогам Кодексу прозорості Закону ЄС про штучний інтелект (EU AI Act), який зобов’язує компанії, що розробляють ШІ, впроваджувати системи для ідентифікації контенту, створеного штучним інтелектом.
Нова публікація Anthropic розпочинається з загального опису принципу роботи водяних знаків. У ній пояснюється, що під час виконання «некритичних завдань» — наприклад, коли модель обирає між словами «хмарно» чи «похмуро» для опису погоди — Claude може впроваджувати в відповіді певний патерн. Цей патерн є «непомітним для читача, але може бути виявлений за наявності спеціального ключа, в якому він зашифрований».
«Водяні знаки не впливають на якість відповідей Claude, — підкреслюють у компанії. — Для кінцевого користувача відповідь із водяним знаком жодним чином не відрізняється від відповіді без нього».
Anthropic повідомила, що застосовуватиме підхід SynthID-Text, який був розроблений командою Google DeepMind у 2024 році, а також планує запустити API для детектування водяних знаків, як зазначено у виданні TechCrunch. Компанія також наголосила на принциповій відмінності маркування водяними знаками від методів виявлення ШІ, які пропонують такі компанії, як Pangram. Останні шукають у тексті стилістичні «ознаки» (наприклад, конструкції типу «це не [X], а це [Y]»), щоб ідентифікувати використання ШІ: «Виявлення таких закономірностей суттєво відрізняється від перевірки на наявність водяного знака».
«Чи можна просто переписати текст, щоб усунути водяний знак? В Anthropic визнали, що це можливо, проте «легке редагування, скоріш за все, не зможе повністю видалити водяний знак», тоді як «повне переписування, коли замінюється кожне слово, дійсно призведе до його усунення».
«У такому останньому випадку, безумовно, виникає питання, чи можна взагалі вважати подібний текст згенерованим ШІ», — додали в компанії.
Стосовно того, чи буде виявлено водяний знак у тексті, який Claude лише вичитував або редагував, в Anthropic відповіли, що це залежатиме від «обсягу тексту та глибини внесених ШІ правок». Якщо редагування було мінімальним, «майже всі слова» залишаться написаними людиною, тому «водяному знаку просто не буде основ для прив’язки (або буде зовсім мало)».
Водночас програмний код отримуватиме менш виражене маркування порівняно зі звичайним текстом. Причина полягає в тому, що модель зобов’язана генерувати функціональний код і не має такого широкого вибору серед численних однаково правильних синонімічних варіантів.
«Водночас програмний код матиме менш помітний водяний знак, ніж звичайний текст, оскільки модель повинна створювати робочий код і не має такого широкого вибору серед безлічі однаково правильних варіантів.
«З огляду на це, у місцях, де існує довільний вибір між конкретними словами чи термінами в межах коду — наприклад, у коментарях — водяний знак може бути застосований, — зауважили в Anthropic. — Однак за своєю суттю він матиме мінімальний вплив на сам згенерований код».
В Anthropic також додали, що Claude не буде єдиним чат-ботом, що маркуватиме текст, оскільки «інші провідні розробники моделей підписали той самий Кодекс практики й також запроваджуватимуть власні методи маркування».
Розробники вже активно шукають способи обійти подібні водяні знаки. Наприклад, у відкритому доступі з’явився інструмент Watermarks Remover. Цей інструмент допомагає перефразовувати текст за допомогою локальної LLM. Отже, якщо маркування полягає у виборі слів, які використовує Claude, достатньо сильне переформулювання може його нейтралізувати. Проте розробник не гарантує стовідсотковий обхід детектора.
Источник: www.vesti-ua.net
