Una filigrana invisibile incorporata nelle parole renderà riconoscibili i testi prodotti da ChatGPT e Codex nell’Unione europea. Il sistema si chiama textGrain e, attraverso un segnale statistico inserito durante la generazione, permetterà a un rilevatore di individuare il passaggio del contenuto attraverso un modello OpenAI. L’introduzione, annunciata il 5 ottobre in risposta agli obblighi di trasparenza dell’AI Act, avverrà nelle prossime settimane e riguarderà le risposte compatibili di tutti i piani dei due servizi nell’UE.
Per gli sviluppatori che utilizzano le API, OpenAI ha scelto un’attivazione facoltativa: dal giorno dell’annuncio, i clienti di tutto il mondo possono abilitare il watermark sui modelli selezionati, mentre l’impostazione predefinita resta disattivata. Nelle prossime settimane la marcatura sarà disponibile anche per gli output dei modelli OpenAI utilizzati attraverso i servizi dei partner cloud.
La filigrana di OpenAI nasce dalla scelta delle parole
Il sistema di OpenAI, textGrain, sfrutta il modo in cui un modello linguistico costruisce una risposta: a ogni passaggio sceglie un token, cioè una parola o una sua parte, fra le continuazioni possibili, ciascuna associata a una probabilità. Collegando queste scelte a una componente pseudocasuale derivata da una chiave segreta e dal contesto precedente, textGrain lascia nel testo un andamento statistico che il rilevatore può riconoscere, senza introdurre caratteri nascosti, spazi invisibili o punteggiatura insolita.
Il meccanismo di textGrain conserva le probabilità originali del modello quando si considera la media sulle chiavi e permette di controllare quanta casualità venga sacrificata per creare il segnale. Per contenere il costo computazionale, lavora su blocchi di token del vocabolario, mantenendo al loro interno le probabilità relative; al momento della verifica bastano il testo e la chiave segreta, senza conoscere il parametro di intensità usato durante la generazione. OpenAI prevede di rendere la tecnologia open source e di ampliare nelle prossime settimane i dettagli tecnici pubblicati.
La qualità delle risposte con il watermark
Nei benchmark di Astra con impostazione max, l’introduzione del watermark non mostra un peggioramento sistematico delle prestazioni: alcuni risultati migliorano, altri scendono leggermente, e OpenAI non rileva differenze significative fra le risposte contrassegnate e quelle prive di filigrana. Il quadro suggerisce che textGrain riesca a incorporare il segnale senza compromettere le capacità del modello nelle attività valutate, dalla programmazione alla ricerca di informazioni e alle risposte scientifiche e sanitarie. Gli aumenti registrati in alcune prove, però, non dimostrano che il watermark renda il modello più capace: il risultato rilevante è l’assenza di un calo sistematico nei test, mentre l’affidabilità del rilevamento resta una questione distinta.
Quando il rilevatore riconosce la filigrana
Il rilevatore può commettere due tipi di errore: trovare una filigrana in un testo che non la contiene, producendo un falso positivo, oppure non riconoscere un segnale presente, producendo un falso negativo. Lunghezza, argomento e modifiche del testo incidono sulla sua capacità di individuare il watermark.
Nei test di OpenAI, textGrain ha eguagliato o superato le alternative valutate, compreso SynthID per il testo, ma la possibilità di riconoscere il segnale cambia con la lunghezza e con il tipo di risposta. Fissando all’1% il tasso di falsi positivi, il rilevatore identifica circa l’80% dei passaggi contrassegnati di 200 token e il 95% di quelli di 400 in ambiti come la psicologia, mentre i risultati sono inferiori in matematica, dove la scelta delle parole è più vincolata.
La riscrittura incide ancora più nettamente: nelle risposte inglesi di 400 token del dataset ELI5, sostituire il 10% delle parole con sinonimi fa scendere il rilevamento dal 92% al 66%, mentre con il 25% di sostituzioni il risultato si riduce al 17%. Anche una traduzione può indebolire la filigrana, perché cambia proprio le scelte linguistiche nelle quali è incorporata.
L’efficacia del rilevamento dipende dunque anche dalla libertà di formulazione lasciata al modello: una risposta che deve essere precisa, la riproduzione di un testo fornito dall’utente o la scrittura di codice offrono meno alternative rispetto alla prosa ordinaria. Il Codice europeo sulla trasparenza dei contenuti generati dall’AI tiene conto di questi vincoli e non richiede watermark nei frammenti di codice o negli output inferiori a 200 token, equivalenti a circa 150 parole in inglese.
Che cosa il watermark non permette di sapere
Il watermark offre un’indicazione limitata sul ruolo dei sistemi OpenAI in un testo. Un rilevamento positivo può segnalare che il modello ha generato o elaborato una parte del contenuto, ma lascia aperte questioni essenziali sulla sua origine e sul lavoro di chi lo ha scritto:
- Non misura il contributo umano. Il segnale non permette di sapere quanto giudizio, revisione o creatività una persona abbia dedicato al testo.
- Non stabilisce proprietà o responsabilità. Non determina chi possieda il testo, se il suo utilizzo sia lecito, se fosse necessario dichiarare l’impiego dell’AI o chi ne sia responsabile.
- Non identifica l’utente. Non associa al testo una persona, un’organizzazione, un account, un prompt o una conversazione.
- Non verifica l’accuratezza. Non permette di stabilire se il contenuto sia vero, fuorviante, dannoso o presentato nel contesto corretto.
- L’assenza di un watermark rilevabile non dimostra che il testo sia stato scritto da una persona. Un contenuto prodotto con gli strumenti OpenAI può essere troppo breve, modificato o tradotto perché il rilevamento funzioni in modo affidabile; può anche provenire da un modello non supportato, essere stato generato prima dell’introduzione della marcatura o arrivare dagli strumenti di un’altra azienda.
Questi limiti, insieme al rischio di falsi positivi e falsi negativi, spiegano perché OpenAI riservi inizialmente il rilevatore testuale a ricercatori e organizzazioni specializzate. Le candidature sono aperte e l’accesso viene approvato caso per caso, per valutare l’affidabilità della tecnologia e gli usi responsabili dei risultati.
Che cosa richiedono le regole europee
L’articolo 50 dell’AI Act chiede ai fornitori di sistemi generativi di rendere testi, immagini, audio e video sintetici riconoscibili dalle macchine, attraverso soluzioni efficaci, interoperabili, robuste e affidabili nella misura tecnicamente possibile. Nel valutare questi requisiti occorre tenere conto delle caratteristiche dei contenuti, dei costi e dello stato dell’arte; sono previste eccezioni per l’assistenza alla normale revisione e per le elaborazioni che non cambiano sostanzialmente i dati forniti o il loro significato.
Per chi pubblica testi generati o manipolati dall’AI per informare il pubblico su questioni di interesse pubblico, esiste invece un obbligo di dichiararne l’origine artificiale, con un’eccezione quando il contenuto è sottoposto a revisione umana o controllo editoriale e una persona fisica o giuridica assume la responsabilità editoriale della pubblicazione. La filigrana inserita dal modello e la dichiarazione rivolta al lettore rispondono quindi a due esigenze distinte, che riguardano rispettivamente il fornitore del sistema e chi ne utilizza il risultato.
Il Codice di buone pratiche sulla trasparenza dei contenuti generati dall’AI, cui OpenAI e Anthropic hanno aderito, traduce questi obblighi in un quadro volontario riconosciuto dalla Commissione europea e dall’AI Board, il comitato europeo per l’intelligenza artificiale, per dimostrare la conformità. Le sue due sezioni separano le regole di marcatura e rilevamento per i fornitori da quelle di etichettatura per chi utilizza i sistemi.
Anthropic applica il watermark anche nelle API e fuori dall’Europa
Con OpenAI, chi usa le API può scegliere se attivare il watermark; con un modello Claude supportato, lo riceve già applicato. È questa la differenza più concreta fra le due aziende, alla quale si aggiunge quella geografica: OpenAI introduce la filigrana nei servizi ChatGPT e Codex per gli utenti dell’UE, mentre Anthropic contrassegna i testi dei modelli compatibili ovunque Claude sia disponibile. La marcatura di Claude accompagna il modello in Claude, Claude Code, Claude Cowork, Claude Tag e Claude Platform, comprese le API, e attraverso AWS, Google Cloud e Microsoft Foundry.
Anthropic ha scelto questa applicazione mondiale perché, al momento dell’introduzione, non disponeva di un metodo sufficientemente stabile per limitarla per regione, e continuerà a valutare altre soluzioni. Il watermark viene inserito automaticamente durante la generazione, senza aggiungere token o costi e con un impatto trascurabile sulla velocità; non contiene informazioni che permettano di risalire a utenti, organizzazioni o conversazioni.
La disponibilità dipende dalla versione di Claude utilizzata. Fable 5.1, Opus 5.5 e Sonnet 5.5 sono fra i modelli che applicano già il watermark, mentre per Fable 5, Opus 4.8 e Sonnet 5 il completamento della distribuzione su Amazon Bedrock è previsto entro il 12 ottobre. Questa distribuzione graduale dipende dalla data di introduzione dei modelli: Anthropic prevede la marcatura fin dall’esordio per quelli introdotti nell’UE dal 2 agosto 2026, mentre la sta aggiungendo alle versioni precedenti durante il periodo transitorio. La data riguarda il calendario di adeguamento dei modelli; il watermark delle versioni supportate resta applicato in tutto il mondo. Nei file supportati prodotti da Claude vengono inoltre inserite Content Credentials C2PA, metadati firmati che registrano la provenienza del file, dove la piattaforma offre questa funzione.
Per verificare i testi contrassegnati, entrambe le aziende prevedono inizialmente un accesso riservato. L’API di Anthropic è in anteprima privata per organizzazioni ammesse, tra cui autorità di regolazione, forze dell’ordine, media, verificatori dei fatti, ricercatori indipendenti, organizzazioni educative e gruppi della società civile europea, oltre alle imprese che devono verificare i watermark per rispettare l’AI Act; Rispetto all’accesso iniziale di OpenAI, concentrato su ricercatori e organizzazioni specializzate, Anthropic include esplicitamente anche questi soggetti nelle categorie ammesse alla verifica; per entrambe, il contrassegno indica un intervento del modello senza stabilire paternità o responsabilità del contenuto.
Per immagini e audio la verifica è già pubblica
Per OpenAI, l’accesso riservato riguarda il rilevatore dei testi, mentre per immagini e audio resta disponibile OpenAI Verify, che cerca nei file caricati i segnali associati ai sistemi dell’azienda. Le Content Credentials basate sullo standard aperto C2PA registrano origine e storia del file, mentre SynthID incorpora una filigrana nel contenuto: combinando i due sistemi, già utilizzati nelle immagini di ChatGPT Images 2.5, le informazioni dettagliate dei metadati si affiancano a un segnale che può resistere ad alcune trasformazioni anche quando conversioni o condivisioni eliminano i metadati stessi.
Le organizzazioni possono integrare questi controlli nei propri prodotti attraverso la Content Provenance API, che cerca metadati C2PA firmati e watermark SynthID supportati nei file immagine e audio. Il risultato riguarda i segnali OpenAI, con una copertura che comprende PNG, JPEG e WebP per le immagini e MP3, Opus, AAC, FLAC, WAV e PCM per l’audio; ogni file può raggiungere 50 MiB, mentre l’audio decodificato deve restare entro 60 secondi.
Per controllare un testo occorre l’accesso dedicato, perché il servizio web verifica immagini e audio. I file caricati su Verify vengono elaborati per cercare i segnali di provenienza, senza essere utilizzati per addestrare i modelli né conservati, salvo obblighi di legge.






