Anthropic va introduce un sistem de watermarking pentru textele generate de noile modele Claude, astfel încât implicarea inteligenței artificiale în crearea unui material să poată fi identificată chiar și după ce textul este copiat și publicat în altă parte. Măsura este implementată în contextul noilor obligații de transparență impuse de AI Act în Uniunea Europeană, însă compania intenționează să folosească marcajul la nivel global.
Spre deosebire de un watermark clasic, sistemul nu adaugă caractere ascunse, cod sau alte elemente suplimentare în text. Marcajul este practic invizibil pentru cititor și este construit direct în procesul prin care modelul alege cuvintele unei fraze. Anthropic susține că metoda nu modifică sensul, calitatea sau lizibilitatea răspunsurilor generate de Claude.
Cum funcționează watermark-ul din textele Claude
Modelele lingvistice generează textul alegând succesiv următorul cuvânt sau token dintre mai multe variante posibile. În multe situații există mai multe formulări care pot transmite același lucru fără ca răspunsul să devină mai puțin corect.
Watermarking-ul folosit de Anthropic intervine tocmai în aceste situații. Atunci când mai multe variante sunt potrivite, sistemul utilizează o cheie pentru a influența sursa de aleatoriu folosită în alegerea cuvintelor. Într-un text suficient de lung apare astfel un tipar statistic care poate fi verificat ulterior cu ajutorul cheii corespunzătoare.
Pentru cititor, un text marcat ar trebui să fie imposibil de diferențiat de unul fără watermark. Anthropic spune că testele interne nu au identificat diferențe semnificative în ceea ce privește calitatea, creativitatea sau lizibilitatea rezultatelor. Compania utilizează o variantă a tehnologiei SynthID-Text dezvoltate de Google DeepMind.
Marcarea este realizată la nivelul modelului, nu doar în interfața Claude. Astfel, atunci când un model compatibil este accesat prin produsele și serviciile în care este disponibil, textul poate păstra același tip de semnal indiferent de aplicația prin care a fost generat.
Watermark-ul poate supraviețui copierii și unor modificări
Unul dintre avantajele metodei este că marcajul nu depinde de metadatele unui document. Copierea unui răspuns Claude într-un editor de text, într-un e-mail sau pe un site nu elimină automat watermark-ul, iar modificările limitate ale textului pot păstra suficient din tiparul statistic pentru ca acesta să poată fi identificat.
Metoda are însă limite importante. Rescrierea extinsă, parafrazarea, combinarea textului cu materiale provenite din alte surse sau utilizarea unor fragmente foarte scurte pot face watermark-ul dificil sau imposibil de detectat. Anthropic confirmă că modificările ușoare nu ar trebui să elimine complet marcajul, în timp ce o rescriere integrală poate face acest lucru.
Și natura textului contează. În pasajele strict factuale, unde există puține variante corecte pentru următorul cuvânt, sistemul are mai puține oportunități de a insera tiparul statistic. Situația este similară în cazul codului sursă, unde alegerea unui termen diferit poate pur și simplu să strice programul.
Detectarea watermark-ului nu dovedește automat că textul a fost scris de Claude
Anthropic avertizează că sistemul nu trebuie tratat drept o metodă infailibilă de stabilire a autorului unui text. Detectarea watermark-ului indică, în esență, probabilitatea ca Claude să fi fost implicat în procesarea materialului.
De exemplu, un utilizator poate scrie singur un articol și apoi poate folosi Claude pentru traducere sau pentru o rescriere substanțială. Textul rezultat ar putea conține watermark chiar dacă ideile și versiunea inițială aparțin utilizatorului. În schimb, o simplă corectură gramaticală efectuată de Claude poate modifica prea puține cuvinte pentru ca implicarea modelului să fie detectabilă.
Prin urmare, prezența watermark-ului nu înseamnă automat „acest text a fost scris de Claude”, iar absența lui nu demonstrează că un sistem AI nu a fost folosit. Anthropic precizează inclusiv că sistemul nu stabilește drepturile de autor sau proprietatea asupra unui material.
Anthropic pregătește un API pentru verificarea textelor
Utilizatorii nu au în acest moment la dispoziție o metodă obișnuită prin care să verifice manual watermark-ul. Anthropic spune însă că pregătește un API dedicat detectării acestuia, iar detaliile despre implementare urmează să fie publicate.
Watermark-ul nu conține nici informații care să permită identificarea utilizatorului, organizației sau conversației în care a fost produs textul. El semnalează doar posibila implicare a Claude.
Pentru fișiere precum imagini PNG, JPG sau SVG, Anthropic folosește o abordare diferită. Compania spune că fișierele compatibile vor putea primi credențiale C2PA semnate criptografic în metadate, care indică faptul că materialul a fost creat sau procesat folosind Claude.
Schimbarea vine odată cu aplicarea noilor reguli europene
Anthropic a semnat Codul de bune practici privind transparența conținutului generat de AI, creat pentru a sprijini implementarea articolului 50 din AI Act. Obligațiile europene privind marcarea și transparența conținutului generat sau manipulat cu inteligență artificială au devenit aplicabile la 2 august 2026. Codul este voluntar, dar cerințele de transparență stabilite de AI Act sunt obligatorii pentru sistemele care intră în domeniul său de aplicare.
Anthropic spune că va activa watermarking-ul la nivel global, nu doar pentru utilizatorii din Uniunea Europeană, deoarece compania nu dispune momentan de o metodă suficient de robustă pentru a limita mecanismul în funcție de regiune. Modelele Claude mai vechi, lansate înainte de 2 august 2026, beneficiază de perioada de tranziție prevăzută de legislația europeană, iar Anthropic intenționează să adauge treptat watermarking și pentru acestea.
Tehnologia ar putea deveni astfel una dintre metodele prin care platformele, publicațiile sau alte servicii încearcă să determine dacă un sistem generativ a fost implicat în realizarea unui text. Totuși, chiar Anthropic subliniază limitele acesteia: watermark-ul oferă un indiciu statistic privind implicarea Claude, nu un verdict definitiv privind cine a scris un material.






