Un language model della classe dei 27 miliardi di parametri che può occupare meno di 6 GB, mantenendo secondo PrismML il 98,2% delle prestazioni aggregate della versione a precisione piena da circa 54 GB. È il risultato alla base di Ternary Bonsai 2 27B, nuova generazione del modello multimodale sviluppato dalla società statunitense nata dalla ricerca del Caltech.
Bonsai 2 27B deriva da Qwen3.8 27B e conserva capacità di reasoning, coding, elaborazione delle immagini e utilizzo degli strumenti. La riduzione delle dimensioni dipende soprattutto da una rappresentazione ternaria nella quale i pesi assumono tre valori, {-1, 0, +1}, associati a fattori di scala FP16 condivisi per gruppi di 128 pesi.
Il modello di partenza non è un 27B di fascia intermedia: nei benchmark pubblicati da Qwen, Qwen3.8 27B si avvicina ai frontier model su diversi test di reasoning e coding e in alcuni workload agentici li supera, pur mantenendo un divario nei compiti più difficili e generalisti.
La rappresentazione del language model arriva, secondo la documentazione tecnica aggiornata, a circa 1,72 bit effettivi per peso, contro i 16 bit di una versione FP16. Il formato GGUF più compatto, denominato PTQ1_0, occupa 5,95 GB, mentre il formato PQ2_0 utilizzato normalmente nella demo privilegia una decodifica meno costosa e sale a 7,21 GB. La model card di Bonsai 2 27B
La distinzione è importante perché i 5,95 GB non rappresentano l’intero pacchetto multimodale in qualsiasi formato. La versione MLX destinata ad Apple Silicon utilizza 7,67 GB per il language model, ai quali si aggiungono 0,92 GB per il vision tower FP16, per un totale di 8,60 GB su disco.
Bonsai 2 27B è distribuito come modello open-weight con licenza Apache 2.0: PrismML rende disponibili pubblicamente i pesi in formato GGUF e MLX, insieme ai runtime necessari per l’inferenza locale.
La seconda generazione riduce il divario con il modello FP16
PrismML aveva presentato il primo Bonsai 27B nel luglio 2026, proponendo una versione binaria orientata alla massima compattezza e una ternaria destinata a conservare una quota maggiore delle capacità del modello originale.
Bonsai 2 mantiene lo stesso principio, ma parte da Qwen3.8 27B e riduce ulteriormente la perdita associata alla compressione.
Nella valutazione tecnica più recente pubblicata dalla società, Bonsai 2 27B raggiunge una media di 84,78 punti su 14 benchmark in thinking mode, contro 86,32 della versione FP16, pari al 98,2% del risultato aggregato.
Il confronto comprende reasoning, matematica, coding, instruction following, tool calling e visione. In matematica il modello ternario ottiene 96,57 contro 97,06 della versione FP16; nel coding 89,42 contro 89,07, mentre nell’instruction following raggiunge 82,66 contro 81,25. Gli scarti più consistenti riguardano knowledge e reasoning, con 79,86 contro 85,55, e la visione, con 66,19 contro 71,36.
Si tratta di benchmark eseguiti e pubblicati da PrismML, quindi non di una valutazione indipendente. La società ha utilizzato la stessa infrastruttura di test basata su EvalScope e vLLM su GPU NVIDIA H100 per confrontare Bonsai 2 con la versione FP16 e con differenti quantizzazioni dello stesso modello.
Dai 16 bit ai tre valori {-1, 0, +1}
La quantizzazione riduce il numero di bit utilizzati per rappresentare i pesi di una rete neurale, diminuendo la quantità di dati che devono essere conservati e trasferiti dalla memoria durante l’inferenza.
Bonsai 2 utilizza una forma particolarmente spinta di questo principio. La maggior parte dei pesi del language model viene ricondotta a tre soli livelli, -1, 0 e +1, con un fattore di scala FP16 per ogni gruppo di 128 elementi.
PrismML applica inoltre una rotazione Hadamard a blocchi prima della quantizzazione, una trasformazione che modifica la base nella quale vengono rappresentati i pesi per distribuirne meglio i valori prima della conversione ternaria; il runtime applica quindi la trasformazione corrispondente alle attivazioni durante l’inferenza.
La quantizzazione a bassa precisione non riguarda soltanto una parte marginale della rete, ma interessa quasi tutto il language model: i livelli che trasformano i token in rappresentazioni numeriche, le matrici utilizzate dai meccanismi di attenzione, i blocchi feed-forward che elaborano queste rappresentazioni e lo strato finale che calcola la probabilità del token successivo. Solo una piccola quota, circa 26,2 milioni di parametri, rimane a precisione superiore, mentre il vision tower della distribuzione MLX resta in FP16. È più corretto parlare di un language model sostanzialmente ternario anziché estendere la definizione indistintamente a ogni componente del sistema multimodale.
5,95, 7,21 o 8,60 GB: perché le dimensioni cambiano
Le diverse cifre associate a Bonsai 2 dipendono dal modo in cui gli stessi pesi ternari vengono memorizzati.
Nel formato PTQ1_0 i valori ternari vengono impacchettati densamente e il language model occupa 5,95 GB, equivalenti a circa 1,75 bit per peso nel file GGUF. PQ2_0 utilizza slot da due bit e raggiunge 7,21 GB, sacrificando una parte della compattezza per semplificare alcune operazioni del runtime.
MLX memorizza invece per ogni gruppo sia una scala sia un bias FP16. Il language model arriva così a 2,25 bit per peso e 7,67 GB; con il vision tower da 0,92 GB, il pacchetto multimodale completo raggiunge 8,60 GB.
Sono quindi implementazioni differenti della stessa rappresentazione ternaria, non modelli con capacità diverse.
Fino a circa 130 token al secondo sulla RTX 5090
Anche le prestazioni dipendono dal packing e dall’hardware utilizzato. Nei benchmark tecnici aggiornati di PrismML, eseguiti attraverso llama.cpp con batch 1, una GeForce RTX 5090 raggiunge 129,9 token al secondo nella generazione con PQ2_0 e 120,5 token al secondo con PTQ1_0.
Una RTX 4090 arriva rispettivamente a 81,2 e 91,1 token al secondo, mentre una L40S raggiunge 74,4 e 81,8 token al secondo.
Su Apple Silicon, PrismML riporta per una precedente build dello stack circa 47 token al secondo su M5 Max, 28,7 su M5 Pro e 18 su M4 Pro. La società precisa che questi risultati Apple sono stati misurati su una build precedente alla versione attuale e devono ancora essere ripetuti sul nuovo stack.
Il comportamento dei due formati mostra anche che una rappresentazione più compatta non è automaticamente più veloce. PTQ1_0 riduce il traffico di memoria, ma il decoding dei valori ternari impacchettati richiede più calcolo; PQ2_0 occupa più memoria, ma può risultare più rapido su architetture nelle quali il limite non è la bandwidth.
La context window arriva a 262K token
Bonsai 2 eredita da Qwen3.8 27B una context window da 262.000 token e un’architettura di attenzione ibrida composta per circa tre quarti da linear attention e per il resto da full attention.
La struttura permette di contenere il costo della gestione di contesti lunghi rispetto a un transformer nel quale tutti i layer utilizzano self-attention completa, anche se sfruttare l’intera finestra continua naturalmente ad aumentare memoria richiesta e tempo di elaborazione del prompt.
Il modello supporta testo e immagini e può effettuare tool calling, caratteristiche che lo rendono utilizzabile per coding agent, analisi locale di documenti, elaborazione di screenshot e workflow agentici.
PrismML mostra Bonsai 2 utilizzato con Cline per attività di programmazione e in workflow di computer use. Sono dimostrazioni della società, non benchmark comparativi, ma indicano il tipo di carico per il quale il modello è stato progettato.
Su quali PC e Mac può essere eseguito Bonsai 2 27B
Il footprint ridotto dei pesi consente a Bonsai 2 27B di essere eseguito anche su sistemi consumer. Il progetto supporta Mac con Apple Silicon attraverso Metal e MLX e PC Windows o Linux tramite CUDA, Vulkan, ROCm oppure, con prestazioni inferiori, in modalità CPU-only.
Su Mac il parametro decisivo è la memoria unificata. Una configurazione da 16 GB può essere sufficiente per eseguire il modello con contesti contenuti, ma lascia poco margine a sistema operativo, KV cache e componente vision. Con 24 GB l’uso diventa più agevole, mentre 32 GB o più permettono di lavorare con maggiore libertà su conversazioni lunghe, immagini e workload più complessi.
Sui PC con GPU dedicata conta soprattutto la VRAM disponibile. Le versioni GGUF di Bonsai 2 occupano circa 6-7 GB per i pesi del language model, per cui una scheda da 8 GB di VRAM rappresenta una configurazione limite ma utilizzabile con contesti ridotti. Con 12 GB il margine cresce sensibilmente; 16 GB costituiscono una configurazione più adatta all’uso continuativo, mentre GPU da 24 GB o più consentono contesti più ampi e maggiore spazio per cache e componenti multimodali.
In termini pratici, il modello può quindi essere eseguito su MacBook Air e MacBook Pro con Apple Silicon, Mac mini e Mac Studio, così come su PC Windows dotati di GPU NVIDIA o AMD compatibili. Le prestazioni variano però molto: un Mac con chip Max o una GPU NVIDIA di fascia medio-alta offrono throughput sensibilmente superiori rispetto a configurazioni base o CPU-only.
La context window massima da 262K token non deve inoltre essere confusa con il requisito minimo di memoria. All’aumentare del contesto cresce infatti anche la KV cache, che può richiedere diversi gigabyte aggiuntivi. Per questo il runtime PrismML dimensiona automaticamente il contesto in funzione della memoria disponibile, rendendo più realistico l’uso del modello anche su sistemi con risorse inferiori rispetto a quelle necessarie per sfruttarne la finestra massima..
L’inferenza AI cerca efficienza oltre la crescita dei parametri
Bonsai si inserisce in una linea di ricerca che sta spostando parte dell’attenzione dalla sola crescita dei modelli alla riduzione delle risorse necessarie per eseguirli. La quantizzazione è uno degli strumenti principali: diminuendo la precisione con cui vengono rappresentati i pesi, consente di ridurre memoria occupata e traffico verso la memoria, due fattori particolarmente rilevanti nella generazione token per token.
Il caso più vicino all’approccio di PrismML è quello dei modelli ternari. Con BitNet b1.58, Microsoft Research ha mostrato già nel 2024 la possibilità di addestrare modelli nei quali ogni peso assume soltanto i valori -1, 0 e +1, con l’obiettivo di avvicinare le prestazioni dei transformer a precisione piena riducendo memoria, latenza ed energia necessarie all’inferenza. Il successivo runtime bitnet.cpp ha esteso il lavoro al lato software, con kernel ottimizzati per sfruttare efficacemente i modelli a 1,58 bit su CPU e GPU.
La riduzione dei bit per peso è però soltanto una delle direttrici. La ricerca sull’inferenza comprende anche sparsità, compressione della KV cache, caching dei prompt, kernel di attenzione più efficienti e speculative decoding, tecnica nella quale un modello più piccolo propone più token che il modello principale può verificare in parallelo. Nel 2026 Microsoft ha mostrato inoltre con Sparse-BitNet come quantizzazione ternaria e sparsità semi-strutturata possano essere combinate, ottenendo nei test pubblicati dalla ricerca incrementi di velocità fino a 1,30 volte.
Un’altra evoluzione della stessa linea di ricerca è BitNet a4.8, che interviene anche sulle attivazioni: utilizza attivazioni a 4 bit in alcune parti della rete, sparsifica gli stati intermedi e adotta una KV cache a 3 bit, cercando quindi di ridurre non soltanto il costo di memorizzazione dei pesi, ma più componenti del carico complessivo dell’inferenza.
Bonsai 2 interviene soprattutto sul peso del modello e sulla bandwidth necessaria per leggerne continuamente i parametri durante il decoding. La sua particolarità è applicare una compressione ternaria molto aggressiva a un modello preesistente da 27 miliardi di parametri mantenendo, secondo i test di PrismML, una quota elevata delle capacità originarie. È quindi un esempio della convergenza tra compressione del modello e ottimizzazione del runtime: ridurre i bit per peso produce un vantaggio concreto soltanto quando software e hardware riescono a sfruttare quella rappresentazione in modo efficiente.
L’intelligence density come alternativa alla sola crescita dei modelli
PrismML è nata da un gruppo di ricercatori del California Institute of Technology (Caltech) ed è stata fondata con il sostegno di Khosla Ventures, Cerberus e Google, cui si è aggiunto successivamente Samsung.
La società concentra la propria ricerca sull’intelligence density, cioè sul rapporto tra capacità del modello e risorse richieste per distribuirlo. La stessa compressione che permette a un modello della classe 27B di essere eseguito su un personal computer può infatti essere utilizzata nei data center per aumentare il numero di modelli o istanze ospitabili entro uno stesso budget di memoria ed energia.
Bonsai 2 27B è interessante soprattutto per questo rapporto. La riduzione sotto i 6 GB riguarda la rappresentazione più compatta del language model e non elimina i costi di context cache, runtime e componenti multimodali, ma colloca un modello da oltre 27 miliardi di parametri in una fascia di memoria che fino a poco tempo fa era associata a modelli molto più piccoli.
Bonsai 2 27B mostra quindi quanto la compressione estrema dei pesi possa cambiare il perimetro dell’inferenza locale. Il 98,2% delle prestazioni aggregate resta un risultato misurato da PrismML sui propri benchmark, mentre il dato strutturale è indipendente da quella valutazione: un language model da oltre 27 miliardi di parametri, che in FP16 richiederebbe circa 54 GB soltanto per i pesi, può essere distribuito in meno di 6 GB nella rappresentazione GGUF più compatta. È questa differenza di ordine di grandezza, più ancora del singolo punteggio di benchmark, a rendere Bonsai 2 interessante per workstation, Mac con memoria unificata e sistemi edge capaci di ospitare modelli che fino a poco tempo fa richiedevano hardware di fascia server.






