L’assegnazione di una richiesta al reparto giusto, la valutazione di un problema e la scelta dell’azione successiva di un agente sono decisioni che il software deve prendere continuamente. I modelli decisionali permettono di affidare queste valutazioni all’intelligenza artificiale e ricevere scelte, punteggi e probabilità che il codice può usare direttamente. Ripetere il procedimento migliaia di volte richiede risposte rapide, affidabili e poco costose: caratteristiche sulle quali si concentra una nuova offerta di modelli specializzati.
L’attenzione suscitata da Jev di TypeSafe AI, il primo della famiglia System One, è stata accompagnata dalla comparsa di progetti come Kev e Laya. Ora Cloudflare propone Clef e Clef-flash, compatibili con l’interfaccia di Jev e capaci di analizzare anche immagini e video. La struttura condivisa delle domande e delle risposte permette agli sviluppatori di provare i nuovi modelli nelle applicazioni che usano già Jev.
Disponibili su Workers AI, sono i primi modelli addestrati dal team della piattaforma Cloudflare. Clef conta 27 miliardi di parametri e privilegia la precisione, mentre Clef-flash, con 9 miliardi, è pensato per i processi che richiedono tempi di risposta più brevi. I pesi di Clef e Clef-flash, insieme al codice, sono scaricabili da Hugging Face con licenza Apache 2.0, consentendo di eseguirli anche sulla propria infrastruttura.
L’evoluzione di Cloudflare verso l’AI
Cloudflare nasce come CDN e reverse proxy, con cache distribuita, DNS e servizi di mitigazione degli attacchi DDoS davanti ai server di origine. Al debutto pubblico del 2010, la proposta consisteva nel rendere accessibili anche ai siti più piccoli strumenti di prestazioni e sicurezza fino ad allora riservati alle grandi piattaforme, riducendo latenza, consumo di banda e carico sull’infrastruttura del cliente. Con Workers, presentato nel 2017, quella rete è diventata anche un ambiente nel quale gli sviluppatori possono eseguire il proprio codice, aprendo la strada a una piattaforma per costruire applicazioni con servizi di archiviazione, gestione dei dati e coordinamento dei processi. L’estensione all’intelligenza artificiale ha preso forma con Workers AI nel 2023, che permette di eseguire modelli sulle GPU della rete senza gestirne direttamente l’infrastruttura, e si è rafforzata con l’acquisizione di Replicate, conclusa nel dicembre 2025, specializzata nell’esecuzione e distribuzione dei modelli. Nel 2026, l’Agent Cloud riunisce strumenti per sviluppare, eseguire e proteggere agenti capaci di svolgere attività in più passaggi; con Clef, Cloudflare aggiunge a questa infrastruttura modelli addestrati dal proprio team e un servizio per adattarli ai processi dei clienti. Il percorso collega così la distribuzione dei contenuti all’esecuzione delle applicazioni, fino alle valutazioni AI che ne guidano il funzionamento.
Dalle domande alle decisioni del software
Per interrogare il modello, lo sviluppatore gli fornisce uno stato, cioè le informazioni che descrivono la situazione da valutare, e uno schema di domande che definisce le risposte ammesse. Come in Jev, i quesiti possono assumere tre forme: Choice permette di scegliere fra opzioni prestabilite, Score di attribuire una valutazione su una scala ordinata e Noul di stimare la probabilità che un’affermazione sia vera. Choice e Score restituiscono anche una misura della confidenza, sulla quale il programma può basarsi per stabilire come usare il risultato e quando chiedere una verifica.
Un ticket che segnala il blocco del checkout, per esempio, può essere esaminato per capire quanto sia urgente, quale reparto debba occuparsene e quanto sia grave l’impatto sui clienti. Su Workers AI si possono porre fino a 64 domande nella stessa richiesta, mantenendo per ciascuna i criteri definiti dallo sviluppatore; cambiare lo schema permette di usare il modello con domande e categorie differenti, senza riaddestrare un classificatore per ogni nuovo insieme di etichette. L’applicazione può poi combinare le valutazioni attraverso le proprie regole, come nel caso di un rimborso per il quale occorre classificare la spesa, valutarne le caratteristiche e applicare le condizioni aziendali all’importo. Anche l’eventuale passaggio a una persona dipende dalla logica del programma, che mantiene il controllo su ciò che accade dopo la risposta del modello.
Questa separazione fra valutazione e azione si ritrova nell’interfaccia condivisa con Jev. La funzione systemone distribuita con Clef-flash accetta il corpo di una richiesta Jev/SystemOne e restituisce la stessa struttura di risposta, con i risultati identificati per domanda e le informazioni sull’utilizzo: chi ha già costruito un’integrazione può quindi sostituire il modello conservando il formato dei dati scambiati. Lo stato, le domande e i criteri delle risposte possono essere inviati attraverso l’API REST di Workers AI oppure mediante il collegamento nativo fra Workers e Workers AI.
Contenuti visivi, contesto e prezzi
La presenza di una componente per la visione permette a entrambi i modelli Cloudflare di lavorare con testo, dati JSON, immagini e video. Un documento fotografato può così essere valutato insieme alle informazioni strutturate che lo accompagnano, ottenendo sempre probabilità associate alle opzioni previste dall’applicazione. Rispetto al Jev testuale descritto nel confronto di Cloudflare, cambia anche la quantità di informazioni che si possono fornire: Clef e Clef-flash hanno una finestra di contesto di 65.536 token, contro i 32 mila di Jev, e possono quindi esaminare uno stato più ampio nella stessa richiesta.
Le due taglie comportano tariffe differenti su Workers AI: Clef costa 0,24 dollari per milione di token in ingresso, mentre per Clef-flash il prezzo scende a 0,09 dollari per milione di token in ingresso. La scelta fra i due può dunque tenere conto del costo delle richieste, della rapidità necessaria nel processo e dei risultati ottenuti sul compito da automatizzare.
La classificazione dei domini nella Threat Intelligence
Un impiego già sperimentato da Cloudflare riguarda la Threat Intelligence, dove Clef lavora insieme a Browser Run per recuperare una pagina, renderizzarla e classificarne il dominio. Nel test interno, l’intera operazione ha richiesto 2,2 secondi, contro i 4,7 secondi di gpt-oss-120b nello stesso flusso. Il modello generalista ha restituito due classificazioni, mentre Clef ha valutato più categorie con le rispettive probabilità: nell’esempio, il dominio riceve il 95% per la moda, l’85% per il commercio elettronico e meno dell’1% per il phishing. Una pagina può essere insieme un sito di moda e un negozio online, perciò le valutazioni riguardano caratteristiche che possono coesistere e, appartenendo a domande differenti, possono superare complessivamente il 100%.
Alla velocità del modello si aggiunge il contributo delle GPU distribuite nella rete Cloudflare, che riducono il percorso di rete delle richieste. Questo consente di inserire Clef nei passaggi che un agente deve completare prima di agire, per scegliere un’operazione o verificarne l’ammissibilità, e di affiancargli un modello linguistico di Workers AI per eseguire il compito. Il nome della famiglia richiama proprio una funzione di orientamento: in musica la chiave assegna un significato alle posizioni delle note sul pentagramma, mentre nel nome Clef le lettere CF rimandano anche a Cloudflare.
Come vengono calcolate le risposte
Il lavoro di Cloudflare sui modelli decisionali è iniziato con esperimenti su DiffusionGemma nella settimana del debutto di Jev, riprendendo la ricerca di Matt Mastracci e i suoi contributi a vLLM. L’esperimento esponeva le probabilità logaritmiche, o logprob, prodotte dal modello, per ricavarne probabilità deterministiche; Clef sviluppa quel principio con una componente specializzata nella valutazione dello schema e con una diversa rete di base, Qwen3.8-27B per la versione maggiore e Qwen3.5-9B per Clef-flash.
Durante l’inferenza, la rete legge il contesto attraverso un passaggio di prefill, cioè l’elaborazione iniziale dell’input, dal quale una componente transformer specializzata ricava le informazioni pertinenti a ciascuna domanda e valuta congiuntamente le opzioni. La decisione è non autoregressiva: le risposte consentite vengono valutate in parallelo, senza generare un testo intermedio un token dopo l’altro. Una singola elaborazione produce così i valori da convertire in probabilità, già organizzati secondo la struttura che il software si aspetta e vincolati alle risposte ammesse dall’applicazione.
Per collegare le opzioni alle informazioni utili, l’architettura organizza l’attenzione in due fasi: dapprima ogni opzione raccoglie il contesto pertinente, quindi i campi possono considerare sia gli altri campi sia il contenuto originale prima del calcolo dei punteggi. A questo si aggiunge un contributo basato sul significato lessicale delle opzioni, che ne preserva l’intento semantico. La valutazione tiene quindi insieme le evidenze specifiche di ciascuna risposta e le relazioni fra le domande, restituendo comunque un risultato entro lo schema definito dallo sviluppatore.
Dati sintetici e probabilità calibrate
Nel post-addestramento di Clef, Cloudflare mantiene fissi i pesi delle reti Qwen e aggiorna la componente di routing insieme ad adattatori a basso rango, con rango 256. La tecnica di adattamento a basso rango concentra gli aggiornamenti in matrici aggiuntive che richiedono meno parametri da apprendere, permettendo di specializzare una rete già addestrata senza modificare i suoi pesi originari. Per questo lavoro vengono usati dati sintetici, ossia esempi costruiti artificialmente nei quali Cloudflare varia l’ordine dei campi, la formulazione dei prompt e la struttura degli schemi: lo stesso genere di decisione viene presentato in modi diversi, affinché il sistema impari a riconoscere le informazioni pertinenti anche quando cambia la loro organizzazione.
L’addestramento combina entropia incrociata con label smoothing e Brier loss, due criteri che intervengono sulla qualità delle risposte e delle probabilità. L’entropia incrociata premia la probabilità assegnata alla risposta corretta, mentre il label smoothing distribuisce una piccola parte del peso anche sulle altre opzioni, evitando un obiettivo rigidamente concentrato su una sola etichetta. La Brier loss misura invece lo scarto quadratico fra le probabilità previste e gli esiti di riferimento e viene usata per affinare la calibrazione, che diventa importante quando il codice deve decidere quanto fidarsi di una valutazione.
Una buona calibrazione delle probabilità significa, per esempio, che fra molti casi ai quali il modello assegna circa l’80% di probabilità che una condizione sia vera, quella condizione risulta effettivamente vera circa otto volte su dieci. Il numero restituito diventa così interpretabile e può guidare la scelta delle soglie con cui il software procede automaticamente oppure chiede un controllo. La Brier loss considera anche altri aspetti della qualità predittiva, perciò il suo valore va distinto da una misura esclusiva della calibrazione.
I premi dell’apprendimento per rinforzo
A questi criteri Cloudflare affianca Reinforcement Learning for Calibrated Decisions, o RLCD, come ulteriore obiettivo di ottimizzazione. Il metodo attribuisce credito parziale alle risposte vicine a quella corretta su una scala ordinata, premia i risultati interamente precisi e applica una penalità rispetto al riferimento per limitare lo spostamento della distribuzione delle risposte. In una scala di gravità composta da “nessuna, bassa, media, alta”, per esempio, scegliere “media” quando la risposta corretta è “alta” costituisce un errore più vicino al risultato atteso che scegliere “nessuna”; il credito parziale permette di tenerne conto durante l’addestramento.
Quando la risposta comprende più campi, il premio per un record interamente preciso favorisce la correttezza dell’insieme delle decisioni, mentre la penalità rispetto al comportamento di riferimento limita gli scostamenti del modello durante l’ottimizzazione. RLCD interviene quindi sul modo in cui vengono premiati i risultati; la calibrazione delle probabilità viene curata anche attraverso la Brier loss. Sono aspetti collegati dell’addestramento, ciascuno con un ruolo nel rendere le valutazioni più utili al software che deve impiegarle.
Il confronto con Jev e gli altri modelli decisionali
La rapidità è il vantaggio più evidente nei test interni di Cloudflare con la suite Decision Index 0.2.1, composta da 43 benchmark: la latenza mediana è di 38,8 millisecondi per Clef-flash, 209,3 per Clef e 524,1 per Jev. Entrambi i modelli Cloudflare mantengono il vantaggio su Jev anche al 95° percentile, cioè il tempo entro il quale si completa il 95% delle richieste, mentre l’accuratezza varia maggiormente in base al compito.
Nei dieci benchmark selezionati per l’annuncio, un modello della famiglia Clef ottiene il risultato migliore in sette casi. Clef si distingue soprattutto su BANKING77 e CLINC150+OOS, mentre la variante flash prevale su API-Bank e nella simulazione degli elettrodomestici. Jev conserva un vantaggio su When2Call e BRIGHT; nella suite più ampia risulta inoltre superiore ai due modelli Cloudflare su GPQA Diamond. Anche fra Clef e Clef-flash emergono differenze rilevanti: su CLINC150+OOS, il modello maggiore è nettamente più preciso, mostrando quanto la scelta della variante dipenda dall’attività da automatizzare.
Il confronto comprende anche DiffusionGemma Jev, Kev 9B e Laya. I punteggi della tabella sono espressi in percentuale e arrotondati come nelle valutazioni pubblicate con i modelli; nDCG@10 misura la qualità dell’ordinamento dei primi dieci risultati, mentre macro-F1 assegna uguale peso alle prestazioni delle diverse classi.
| Benchmark e metrica | Clef | Clef-flash | Jev | DiffusionGemma Jev | Kev 9B | Laya |
|---|---|---|---|---|---|---|
| BFCL, corrispondenza esatta | 98,5 | 98,8 | 95,8 | 96,5 | 94,5 | 38,1 |
| ToolRet, nDCG@10 | 69,2 | 66,4 | 65,3 | 61,2 | 64,3 | 12,8 |
| API-Bank, accuratezza | 91,9 | 93,1 | 88,2 | 83,7 | 56,3 | 11,5 |
| Home appliances, corrispondenza esatta | 83,0 | 97,7 | 52,3 | 42,0 | 25,0 | 0,0 |
| When2Call, accuratezza | 72,4 | 65,6 | 81,0 | 75,4 | 49,6 | 11,9 |
| BANKING77, macro-F1 | 94,2 | 90,9 | 79,7 | 74,3 | 84,8 | 14,3 |
| CLINC150+OOS, macro-F1 | 97,4 | 66,8 | 89,3 | 83,5 | 79,0 | 3,2 |
| BRIGHT, nDCG@10 | 45,9 | 39,3 | 47,5 | 42,9 | 38,5 | 19,9 |
| Amazon ESCI, macro-F1 | 57,5 | 57,4 | 55,2 | 53,4 | 49,2 | 24,4 |
| PhishNChips, accuratezza | 79,6 | 75,0 | 62,5 | 85,4 | 50,7 | 50,1 |
Laya registra la latenza mediana più bassa fra i modelli confrontati, accompagnata però da risultati di qualità inferiori nei dieci compiti riportati. Kev 9B e DiffusionGemma Jev si collocano fra Clef-flash e Clef per rapidità alla mediana; considerando il 95° percentile, entrambi risultano più lenti della variante flash e più rapidi di Clef. Il confronto rende quindi visibili sia le differenze di accuratezza sia il comportamento dei modelli sui tempi di risposta.
Nei quattro flussi aziendali TypeSafe, Clef supera Jev nell’elaborazione delle fatture, nell’assistenza clienti e nella gestione degli incidenti di sicurezza, mentre Jev prevale nell’osservabilità degli agenti. Clef-flash ottiene il risultato migliore nell’assistenza, dove i tre modelli sono molto vicini, ma resta dietro gli altri due sulle fatture; sugli incidenti di sicurezza eguaglia Jev e, nell’osservabilità, si colloca fra Jev e Clef. Tutti affrontano la stessa revisione dei dati e lo stesso insieme di casi, con risposte di riferimento basate sul consenso.
La personalizzazione con gli ingegneri Cloudflare
Per adattare Clef a un’attività specifica, Cloudflare offre un servizio di fine-tuning nel quale i clienti lavorano con i Forward-Deployed Engineers, o FDE, ingegneri che li affiancano direttamente per specializzare il modello sui loro dati, carichi di lavoro e processi applicativi. Questa collaborazione costituisce la prima fase del servizio, dal quale Cloudflare intende sviluppare una piattaforma self-service per raccogliere i dati, addestrare il modello e ridistribuirlo sulla propria infrastruttura.
Il lavoro parte dalle richieste e dalle risposte raccolte attraverso AI Gateway, che possono formare il dataset del cliente, e prosegue con Workers AI per generare i rollout, cioè le esecuzioni con cui il modello viene provato sui casi da affrontare. Containers fornisce una sandbox nella quale attribuire un punteggio alle azioni e riprodurle durante l’ottimizzazione; il nuovo Trainer aggiorna poi i pesi del modello, che viene nuovamente distribuito attraverso Workers AI e Bring Your Own Model. Quest’ultimo supporto rientra nel lavoro su Cog proseguito dopo l’acquisizione di Replicate, collegando la personalizzazione al successivo impiego del modello.
La disponibilità dei dati per il fine-tuning dipende dalla scelta di usare il servizio di personalizzazione. Per l’inferenza ordinaria, Cloudflare garantisce che richieste e risposte non vengono lette, memorizzate o impiegate nell’addestramento; quando il cliente decide di adattare Clef, vengono invece utilizzati i dati scelti a questo scopo. La specializzazione può scambiare parte delle prestazioni generali con una maggiore accuratezza nel dominio selezionato, usando decisioni già etichettate per insegnare al classificatore i criteri propri di quel processo.
Cloudflare sta già lavorando con i propri team su attività come la valutazione delle segnalazioni Trust & Safety, lo smistamento delle richieste di assistenza e la classificazione dei bot, potendo attingere a oltre 15 anni di dati di rete. Il fine-tuning permette di adattare Clef alle policy sulle segnalazioni o alle regole con cui distinguere i crawler legittimi dai bot indesiderati; i clienti che hanno carichi specifici da affrontare possono candidarsi come design partner.






