Con 49 miliardi di parametri attivi e una finestra di contesto da un milione di token, Mistral Large 4 combina ragionamento, comprensione delle immagini e uso di strumenti in un modello multimodale addestrato nei data center europei della società francese e disponibile dal 6 ottobre in anteprima pubblica attraverso le API di Mistral Studio. La pubblicazione dei pesi è prevista entro la fine del mese, mentre prosegue il lavoro di addestramento e valutazione del modello, soprannominato dalla società “Le Chonk”. Il nome combina l’articolo francese con chonk, termine dello slang inglese usato affettuosamente per un animale grosso e paffuto, soprattutto un gatto: un soprannome adatto alle dimensioni del modello, che richiama anche l’immaginario felino di Le Chat.
Meet Mistral Large 4, aka Le Chonk.
• 1T parameters, natively multimodal. 49B active.
It is the best open weights model from US or Europe on aggregated benchmarks.
• State-of-the-art on critical workloads, including cyber defense, manufacturing and finance and it surpasses closed frontier models on visual grounding.
• Forged in Europe end-to-end and is deployable from Europe via our own Mistral Cloud infrastructure.
• Available to all via API today. Working with cybersecurity partners privately.Open weights release end of October.
— Mistral AI (@MistralAI) October 6, 2026
Le applicazioni spaziano dallo sviluppo software alle operazioni di sicurezza, dai documenti finanziari ai disegni industriali. Mistral lo presenta come il proprio modello più grande e capace, con prestazioni competitive rispetto ai principali modelli a pesi aperti e risultati particolarmente elevati nei carichi professionali di cybersecurity, finanza e diritto.
Oltre mille miliardi di parametri, con 49 miliardi attivi
I 1.050 miliardi di parametri totali di Large 4 sono organizzati in un’architettura Mixture-of-Experts – MoE. che impiega componenti specializzate e ne attiva una parte durante l’elaborazione: i 49 miliardi di parametri attivi descrivono quindi la porzione utilizzata, mentre il totale esprime le dimensioni complessive del modello. Il codificatore visivo conta 1,6 miliardi di parametri.
La finestra da un milione di token – le unità in cui il modello rappresenta il contenuto – permette di lavorare con grandi quantità di informazioni nella stessa richiesta. Le funzioni disponibili comprendono risposte strutturate, chiamate a funzioni esterne, domande e risposte sui documenti, elaborazione in batch e integrazione con le API per agenti e conversazioni, inclusi gli strumenti incorporati nella piattaforma.
Il contesto da un milione di token si sta diffondendo fra i modelli per il lavoro professionale, con diversi annunci concentrati a settembre. Claude Opus 5.5, presentato il 22 settembre, e Claude Sonnet 5.5, annunciato il 28, offrono entrambi questa capacità. Il 29 settembre è arrivato GPT-6.1 Sol, con una finestra di 1,05 milioni di token; il giorno successivo Google ha annunciato Gemini 4 Argon, con un limite di un milione di token e un accesso iniziale riservato a operatori della difesa informatica selezionati attraverso il programma Fairwind.
La crescita amplia la quantità di codice, documenti e risultati degli strumenti che un agente può mantenere disponibili durante un’attività, rendendo possibile affrontare repository estesi e analisi su più fonti nella stessa sessione. Capacità del contesto e lunghezza della risposta sono misure distinte: Opus 5.5, Sonnet 5.5 e GPT-6.1 Sol, per esempio, possono produrre al massimo 128.000 token in uscita, pur gestendo un contesto molto più ampio.
Sul piano linguistico, i dati di addestramento comprendono oltre 160 lingue, fra cui tutte quelle ufficiali dell’Unione europea. La componente multimodale consente di analizzare documenti complessi, grafici e immagini naturali, combinando l’interpretazione visiva con sequenze di azioni e verifiche.
Dai data center europei all’esecuzione nelle infrastrutture aziendali
Per costruire Large 4 da zero, Mistral ha utilizzato 3.800 GPU Nvidia Grace Blackwell nei propri data center europei. Anche l’anteprima pubblica viene erogata sulla stessa infrastruttura. Il piano di distribuzione comprende più regioni nel mondo e un’implementazione europea gestita integralmente da Mistral, indipendente da altri fornitori di servizi digitali e soggetta alla legislazione europea.
Il progetto collega così disponibilità dei pesi e controllo del calcolo. Con il rilascio previsto a ottobre, le organizzazioni potranno eseguire il modello in cloud privato o on-premise, applicando le proprie politiche operative. Per la sicurezza informatica, questa possibilità riguarda anche la continuità degli strumenti durante un incidente e la gestione delle attività di ricerca sulle vulnerabilità.
La traiettoria si inserisce nella strategia di infrastruttura sovrana europea di Mistral. Alla costruzione del modello hanno contribuito collaborazioni con imprese della finanza, dell’ingegneria, della manifattura, della logistica, della farmaceutica, della ricerca scientifica, del trasporto marittimo e del settore pubblico. L’ambiente di addestramento, personalizzazione e apprendimento per rinforzo è lo stesso offerto ai clienti attraverso Mistral Forge.
La ricerca delle vulnerabilità comprende riproduzione e correzione
Nell’Artificial Analysis Cyber Index, dedicato alla capacità di individuare e correggere falle nel software reale, Large 4 si colloca fra i primi cinque modelli a livello mondiale. Sul test che richiede di riprodurre una vulnerabilità effettiva in software open source e poi correggerla, il risultato è 82%, il più alto fra i modelli confrontati da Mistral. Su Cybench, che raccoglie 40 esercizi tratti da competizioni di sicurezza, raggiunge il 93%.
Claude Opus 5.5 e GPT-6 Astra ottengono risultati vicini allo zero nel test di riproduzione e correzione perché rifiutano il compito, secondo il confronto di Mistral. La misura comprende quindi la disponibilità a svolgere l’attività richiesta, oltre alla capacità tecnica. Dimostrare concretamente una falla è un passaggio rilevante anche per la difesa del software.
Le prove interne hanno inoltre evidenziato applicazioni nell’analisi di malware, nella definizione delle priorità delle vulnerabilità e nella scrittura di regole di rilevamento, comprese attività diverse da quelle usate esplicitamente nell’addestramento. Le dimostrazioni comprendono analisi preliminare di malware e risoluzione di sfide Capture the Flag, gli esercizi competitivi in cui occorre trovare vulnerabilità o superare problemi di sicurezza.
Prima della pubblicazione dei pesi, Mistral sta svolgendo test avversariali in contesti reali con operatori della cybersecurity, partner selezionati e autorità statali. Si tratta di prove in cui i valutatori cercano deliberatamente di mettere in difficoltà il modello, aggirarne le protezioni o indurlo a produrre risposte pericolose, così da individuare vulnerabilità e comportamenti da correggere. Questi soggetti accedono allo stesso modello con moderazione ridotta e capacità cyber ampliate.
Gli agenti lavorano su repository, terminali e applicazioni aziendali
Per lo sviluppo software, i risultati riportati dall’indice di Artificial Analysis sono 61,7% su DeepSWE v1.1, 59,4% su SWE-Atlas-QnA e 28,3% su Terminal-Bench 4. Le prove riguardano ingegneria del software, comprensione dei repository e operazioni complesse da terminale. Il punteggio combinato del Coding Agent Index è 49,8%, superiore a quello di DeepSeek V4 Pro 0813 e Qwen3.8 Max. Per Vibe Code Bench v1.1, Mistral utilizza invece i risultati di vals.ai.
Una valutazione condotta con Surge AI ha chiesto ad annotatori professionali di giudicare la qualità del codice su una scala da uno a cinque, nascondendo l’identità dei modelli. Large 4 Preview si è classificato secondo su cinque con 3,74 punti: davanti a Kimi K3, con 3,59, GLM-5.3, con 3,60, e GLM-5.2, con 3,40; Claude Opus 5 ha ottenuto 4,22.
Le capacità agentiche si estendono a processi in cui il sistema raccoglie informazioni, utilizza strumenti e produce un risultato finale. Su AutomationBench, composto da 657 workflow aziendali attraverso applicazioni come Gmail, Google Sheets, Slack e Salesforce, il modello raggiunge il 59,9%, davanti a Kimi K3, MiMo-V2.6-Pro e DeepSeek V4 Pro. Su AA-Briefcase, che valuta attività professionali prolungate e la produzione di fogli di calcolo, presentazioni e PDF, ottiene 1.393 punti Elo, superando DeepSeek V4 Pro. Il punteggio Elo rappresenta una valutazione relativa delle prestazioni, distinta dalle percentuali di successo delle altre prove.
La visione guida verifiche su disegni tecnici e immagini gigapixel
Il visual grounding associa gli elementi descritti alla loro posizione nell’immagine e permette al modello di individuare oggetti e componenti durante l’analisi visiva. Su Dense 200, Mistral riporta il 42% per Large 4 e il 41% per GPT-6 Astra.
La combinazione con gli agenti permette di ingrandire una porzione dell’immagine, ispezionarla e verificare la risposta attraverso più passaggi. Le dimostrazioni includono l’identificazione di oggetti in scene naturali dense, il controllo di componenti meccanici nei disegni tecnici, il recupero di evidenze da PDF e l’esame di immagini geospaziali di dimensioni gigapixel. Queste attività interessano ingegneria, manifattura e osservazione della Terra, comprese le operazioni di risposta ai disastri. ChartQA Pro misura la capacità di interpretare grafici, infografiche e dashboard e di rispondere a domande sui dati rappresentati. GDP.pdf verifica invece se il modello sa ricavare risposte corrette da PDF professionali, collegando informazioni presenti in testi, tabelle e disegni, come quelli di contratti, manuali e progetti tecnici.
Dai documenti finanziari alle simulazioni scientifiche
Large 4 crea, modifica e corregge fogli di calcolo e documenti complessi per attività finanziarie e legali. Nelle valutazioni di vals.ai su compiti finanziari e legali, Mistral riporta risultati superiori a GPT-6 Astra; su Harvey AI Legal Agent, Large 4 supera i modelli aperti confrontati. Finance Agent v2 misura il lavoro degli agenti finanziari, mentre Finch, o FinWorkBench, valuta la costruzione e modifica di fogli di calcolo per casi reali di finanza e contabilità.
Una dimostrazione mette a confronto Large 4 e Mistral Medium 3.5 su un’indagine di finanza aziendale articolata in più passaggi, attraverso documenti societari pubblici e rapporti finanziari, inclusi quelli disponibili in EDGAR e nelle banche dati europee equivalenti. Una mappa semantica animata mostra i documenti recuperati, le evidenze raccolte, i calcoli e le questioni ancora da risolvere durante i due percorsi di analisi.
Per la ricerca, Large 4 può generare codice destinato ad analisi dei dati, modellazione e simulazioni fisiche. Su SciCode-Verified, che valuta l’implementazione di workflow scientifici in fisica, matematica, scienza dei materiali e biologia, Mistral indica prestazioni allo stato dell’arte fra i modelli a pesi aperti. Un esempio applicativo è la generazione in un’unica esecuzione di una simulazione Hartree–Fock, metodo della chimica computazionale per approssimare la struttura elettronica attraverso una serie di routine specialistiche.
Le valutazioni umane interne segnalano un ragionamento matematico più preciso e strutturato rispetto a GLM-5.3, anche in attività prolungate di matematica applicata e fisica teorica. Nel confronto condotto da esperti di coding, progettazione assistita da computer (CAD), finanza, matematica e fisica, Large 4 è stato preferito nei compiti CAD e scientifici, con risultati alla pari o vicini a GLM-5.3 in finanza e programmazione.
La resistenza agli attacchi cresce insieme alle capacità operative
Sul benchmark pubblico B3 di Lakera, Large 4 resiste al 93,3% degli attacchi. Mistral segnala inoltre la saturazione dei propri test di robustezza alle prompt injection indirette, cioè istruzioni malevole inserite nei contenuti che un agente consulta. I confronti comprendono GLM-5.2, GLM-5.3, Kimi-K2.6, Kimi-K3 e DeepSeek V4 Pro 0813.
Su KORA, relativo al comportamento responsabile nelle interazioni, il punteggio è 1,691 su un massimo di due; il valore massimo corrisponde al livello esemplare. Per le richieste cyber malevole di JailbreakBench, StrongREJECT e AgentHarm, il tasso medio di rifiuto è superiore a quello dei modelli aperti confrontati, pur mantenendo le prestazioni nelle attività di sicurezza legittime.
Il post-training combina affinamento supervisionato e reinforcement learning, l’apprendimento per rinforzo che usa gli esiti dei tentativi del modello per migliorarne il comportamento. L’infrastruttura impiega un’interfaccia componibile per associare conversazioni, problemi scientifici, sicurezza, accuratezza fattuale e utilizzo prolungato di strumenti. Gli ambienti condividono sandbox per il codice, ricerca web e API esterne; la verifica combina modelli di ricompensa, test del software, valutazioni di altri modelli e controlli statici.
Decine di migliaia di traiettorie di esecuzione vengono generate in parallelo mentre l’addestramento procede in modo asincrono. La pipeline supporta percorsi lunghi con budget di milioni di token e più operazioni di compattazione del contesto, contenendo il disallineamento fra il modello che genera gli esempi e quello in addestramento. Su una scala di circa 3.000 GPU, una singola esecuzione produce 33 miliardi di token al giorno, dei quali circa 16 miliardi sono token di completamento utilizzabili per l’addestramento dopo filtraggio e mascheramento. Mistral riferisce che i miglioramenti si trasferiscono anche alle valutazioni esterne agli ambienti di training.
API già disponibili, prezzi dimezzati per due settimane
L’API dell’anteprima utilizza l’identificativo mistral-large-4. Le tariffe standard sono 1,36 dollari per milione di token in ingresso, 0,14 dollari per l’input in cache e 4,18 dollari per milione di token in uscita. Il prezzo promozionale di debutto prevede uno sconto del 50% per due settimane: rispettivamente 0,68, 0,07 e 2,09 dollari per milione di token.
Il rilascio dei pesi entro fine ottobre sarà accompagnato da ulteriori dettagli sull’architettura, benchmark aggiuntivi e informazioni sul post-training. L’anteprima è il primo traguardo della roadmap sostenuta dal round Serie D da 3 miliardi di euro, che finanzia anche l’espansione del calcolo nei data center europei. L’apprendimento per rinforzo è ancora in corso; Mistral prevede ulteriori miglioramenti nelle settimane e nei mesi successivi e utilizzerà Large 4 come base per una nuova generazione di modelli specializzati e ottimizzati per settori e carichi di lavoro specifici.






