Samuel Algherini
Dal 2 agosto 2026 l’Unione Europea chiede ai fornitori di modelli di intelligenza artificiale di applicare un watermark, ovvero di “marcare” i contenuti che vengono generati. Anthropic, insieme alle altre big tech e a circa 190 firmatari complessivi, ha aderito a luglio al Codice di buone pratiche europeo (the Code of Practice for General-Purpose AI) sulla trasparenza dei contenuti generati dall’AI.
Bene, ma come funziona questo watermark e quanto è affidabile? Scaviamo un pochino più a fondo. Molti di noi quando pensano alla parola “watermark” il primo riferimento che viene in mente è quello della filigrana delle banconote, qualcosa che potremmo vedere in controluce. Non è questo il caso, qui non c’è nulla da vedere. Al testo non viene aggiunto alcun carattere nascosto, simbolo camuffato, metadato mascherato o cose del genere. Il segno sta tutto nella scelta delle parole. Per capire come sia possibile bisogna fare un passo indietro e guardare a come scrive un modello linguistico.
Come scrive un modello: un pezzo alla volta
I LLM che abbiamo oggi sono basati su un’architettura chiamata Trasnformer e la particolarità che tali modelli non compongono una frase intera in un colpo solo. Procedono invece parola per parole, o meglio token per token, dove con quest’ultimo intendiamo parola o parte di parola o segno di punteggiatura (è l’unità minima con cui lavora un modello). Ad ogni “passo” il modello guarda la sequenza di testo scritta fino a quel momento e calcola quale ventaglio di parole sono le candidate migliori per seguire la sequenza. Ognuna, in base alla sua “appropriatezza” ha una percentuale di essere scelta.
Prendiamo l’inizio di frase “Stamattina sono uscito presto e ho preso un…”. Il modello assegnerà una probabilità ai token “caffè”, un po’ più bassa ad “autobus” o “taxi”, e quasi nulla a “mercurio”. A questo punto sceglie. La scelta non verte necessariamente sul candidato più probabile: il modello estrae tra i candidati plausibili, dando peso maggiore a quelli più probabili. È proprio questo il motivo per cui la stessa domanda posta due volte ottiene risposte formulate in modo diverso. Il token scelto viene aggiunto al testo e il procedimento ricomincia di nuovo e viene ripetuto per ogni iterazione fino al completamento della risposta, dove il completamento, il punto finale, è anch’esso frutto della scelta probabilistica di metterci un bel punto. Questo meccanismo si chiama next token prediction, ed è alla base di tutti i grandi modelli linguistici.
Un aspetto interessante per quanto concerne il watermark, che ora andiamo a introdurre, è che diverse di queste scelte hanno conseguenze minime. Se la frase è “La riunione è stata lunga e…”, che il modello continui con “faticosa” o con “stancante” cambia poco per chi legge. Ricordiamo che la scelta è, di fatto, data da un numero (pseudo)casuale.
Dove si nasconde il watermark: cambiare il dado
Il watermark sfrutta proprio queste scelte a basso rischio. Lascia intatti i token candidati e le loro probabilità, e interviene su un solo elemento: la fonte della casualità. Invece di affidarsi a un generatore di numeri casuali qualsiasi, l’estrazione viene determinata combinando due ingredienti: una chiave segreta custodita da Anthropic e i pochi token che precedono il punto in cui si sta scegliendo.
La chiave è, in sostanza, un valore segreto che funziona come il seme di un generatore di numeri. Per chiunque non la possieda, le scelte del modello continuano a sembrare del tutto casuali. Per chi la possiede diventano ricostruibili: a parità di parole precedenti e di chiave, l’estrazione va sempre nella stessa direzione.
Anthropic propone un’analogia efficace. Immaginiamo una partita a Monopoli in cui, invece di lanciare i dadi, i giocatori usano le cifre del pi greco partendo da un punto qualsiasi della sequenza. Per chi gioca non cambia nulla: le mosse restano imprevedibili e la partita procede normalmente. Chi però conosce il pi greco e osserva a posteriori la sequenza delle mosse può accorgersi che coincide con quella sequenza di cifre. La partita, in questo senso, è “marked”.
Due precisazioni evitano fraintendimenti. Il watermark non spinge il modello a preferire sempre una certa parola: “faticosa” potrà uscire in una frase e “stancante” nella successiva, a seconda del contesto. E non lo porta a scegliere parole che altrimenti non avrebbe considerato: un termine raro o bizzarro resta improbabile come prima. Il metodo adottato è una versione di SynthID-Text, pubblicato da Google DeepMind su Nature nel 2024, a sua volta parte di una famiglia di tecniche che risale a una proposta di Scott Aaronson del 2022. Secondo i test interni di Anthropic e lo studio di DeepMind, i lettori non percepiscono differenze di qualità tra testi con e senza watermark.
Come si verifica: una questione di statistica
Chi dispone della chiave può ripercorrere un testo e, in ogni punto in cui il modello aveva libertà di scelta, controllare se la parola presente è coerente con ciò che la chiave avrebbe suggerito. Un testo scritto da una persona coinciderà ogni tanto, per puro caso. Un testo generato da Claude con watermark coinciderà più spesso di quanto il caso spiegherebbe.
Un paragone aiuta a capire perché la risposta non è mai un sì o un no. Se una moneta dà testa 7 volte su 10, non si può dire nulla. Se dà testa 700 volte su 1.000, il sospetto che sia truccata diventa fortissimo. La verifica del watermark ragiona allo stesso modo: il risultato è una probabilità, e la sua affidabilità dipende da quante “monete” si hanno a disposizione, cioè da quante scelte libere contiene il testo.
Testi lunghi e liberi, testi brevi e vincolati
Da qui discende la caratteristica più importante di questo watermark: funziona in modo molto diverso a seconda del tipo di testo.
Un testo lungo e aperto offre centinaia di scelte libere. Una lettera motivazionale di una pagina, un post di 600 parole, un racconto, una mail articolata o un saggio breve contengono moltissimi punti in cui il modello poteva scegliere tra alternative equivalenti. Qui il segnale si accumula e la verifica può arrivare a un grado di confidenza elevato.
Un testo breve ne offre pochissime. Una risposta come “Grazie, ci vediamo giovedì alle 10” contiene poche parole e ancora meno scelte davvero libere: il segnale è troppo debole per dire qualcosa.
Un testo fattuale o vincolato riduce ulteriormente lo spazio. Dopo “La Divina Commedia è stata scritta da…” esiste una sola risposta corretta, e il watermark non ha margine per agire. Lo stesso vale per “2 + 2 =”. Il codice informatico è un caso simile: nella maggior parte dei punti deve essere esatto, altrimenti non funziona, e il watermark può inserirsi quasi solo nei commenti.
Poi ci sono i casi intermedi. Se si chiede a Claude di correggere solo grammatica e punteggiatura di un testo scritto da una persona, quasi tutte le parole restano quelle dell’autore e il watermark può vivere soltanto nelle poche correzioni, spesso troppo poche per essere rilevate. Una leggera revisione umana di un testo generato probabilmente non cancella il segno. Una traduzione fatta da Claude, invece, porta il watermark, perché ogni parola del testo tradotto è stata scelta dal modello.
Più che approssimativo, quindi, il watermark è probabilistico e graduato: la sua capacità di dire qualcosa cresce con la lunghezza del testo e con la libertà espressiva che il compito lasciava al modello.
Cosa il watermark può dire, e cosa no
Con la chiave di Anthropic si può rispondere a una sola domanda: quanto è probabile che Claude abbia contribuito a questo testo? Il watermark non dimostra che un testo sia stato scritto da una persona. Non rileva altri modelli, che useranno chiavi proprie o metodi diversi. Non distingue tra un testo scritto da Claude e uno pesantemente rielaborato da Claude. Non contiene informazioni sull’utente, sull’organizzazione o sulla conversazione, e non dice nulla su chi sia l’autore in senso legale o il proprietario del contenuto.
Il metodo è anche diverso da quello dei software di rilevamento dell’AI oggi in circolazione, che non hanno accesso alla chiave e lavorano sugli indizi stilistici: certe costruzioni ricorrenti, certe parole usate con frequenza sospetta. Sono due approcci di natura differente, uno statistico e legato al produttore, l’altro stilistico e indipendente.Una conseguenza pratica riguarda da vicino scuole e università. L’assenza di un watermark rilevabile in un testo breve, in una correzione di bozze o in un elaborato riscritto a mano non equivale a una prova di scrittura umana. E un segnale debole su un testo corto resta, appunto, debole.
Chi custodisce la chiave
Per ora la verifica passa da un’interfaccia di rilevamento messa a disposizione da Anthropic in accesso riservato: autorità di regolazione, forze dell’ordine, media, fact-checker, ricercatori indipendenti, istituzioni educative, organizzazioni della società civile europea e aziende che devono verificare il watermark per i propri obblighi di conformità. L’azienda dichiara di voler estendere l’accesso nel tempo. Il quadro che ne risulta ha una struttura precisa. Ogni fornitore marca i propri testi con la propria chiave e stabilisce chi può interrogarla. Non esiste un controllo unico: per sapere se un testo proviene da un modello di AI occorre chiederlo, separatamente, a ciascun produttore. La domanda “chi ha scritto questo testo?” si sposta così dal piano dello stile a quello della statistica, e dal giudizio di chi legge alla disponibilità di chi detiene la chiave.



