VMware Cloud Foundation, cinque modelli AI convalidati per il cloud privato

Broadcom ha convalidato Nemotron 3, Gemma 4, cotomi, Qwen 3.7-Max e GLM 5.2 per l’esecuzione su VMware Cloud Foundation. L’annuncio, presentato a VMware Explore 2026, permette alle aziende di installare on-premise modelli di NVIDIA, Google DeepMind, NEC, Alibaba Cloud e Z.ai e di renderli disponibili ai propri utenti attraverso un servizio interno di Model as a Service.

La convalida inserisce i modelli in una piattaforma nativa per l’AI e Kubernetes, capace di eseguire contemporaneamente inferenza, applicazioni agentiche, servizi containerizzati e macchine virtuali tradizionali. VCF offre un percorso pronto per la produzione, evita di creare uno stack operativo distinto per ciascuna categoria di carico di lavoro e mantiene modelli e dati all’interno dell’infrastruttura privata dell’organizzazione.

Il Private Cloud Outlook 2026 di Broadcom rileva che il 56% delle aziende esegue già o prevede di eseguire inferenza AI in produzione nel cloud privato. La scelta è associata soprattutto a privacy, sicurezza, governance, sovranità dei dati e controllo della tokenomics, cioè dei costi legati alla generazione e al consumo dei token.

Un runtime comune per oltre 150 modelli

VMware Cloud Foundation mette a disposizione un ecosistema aperto ed estensibile e utilizza vLLM come runtime predefinito per l’esecuzione e l’erogazione dei modelli. vLLM è un progetto open source per l’inferenza e il serving degli LLM, sviluppato inizialmente allo Sky Computing Lab dell’Università della California, Berkeley, e progettato per gestire con efficienza memoria, richieste simultanee e distribuzione del calcolo. Attraverso questo runtime, i clienti possono utilizzare su VCF oltre 150 modelli open source.

La piattaforma supporta elaborazione mista su GPU e CPU di AMD, Intel e NVIDIA, lasciando alle aziende la scelta dell’hardware adatto ai diversi carichi di lavoro. I risultati ottenuti secondo lo standard MLPerf Inference 5.1 mostrano per VCF prestazioni in linea con il bare metal anche con un utilizzo elevato delle GPU; CPU e memoria non impiegate dalle macchine virtuali dedicate all’inferenza possono rimanere disponibili per altri workload isolati.

Il catalogo dei modelli convalidati costituisce uno dei servizi di VMware AI Factory, la base software-defined di VMware Private AI Cloud. AI Factory automatizza il percorso dal provisioning dell’infrastruttura alla messa in servizio dei modelli; le cinque nuove convalide ampliano l’insieme dei modelli eseguibili su VCF e distribuibili come servizio agli utenti.

“Collaborando con i principali fornitori mondiali di modelli di AI, offriamo alle organizzazioni un percorso chiaro verso la sovranità dei dati e un’AI conveniente su larga scala, con modelli all’avanguardia disponibili in modo sicuro e forniti come servizio alla loro comunità di utenti attraverso i servizi integrati di VMware Cloud Foundation”, afferma Chris Wolf, Global Head of AI and Advanced Services della divisione VMware Cloud Foundation di Broadcom.

Nemotron 3 per workflow agentici di lunga durata

La famiglia NVIDIA Nemotron 3 comprende modelli multimodali aperti destinati alle applicazioni agentiche. L’architettura ibrida Mamba-Transformer MoE combina i meccanismi Transformer con Mamba, progettato per elaborare sequenze lunghe in modo efficiente, e con una struttura Mixture-of-Experts: per ogni token viene attivata soltanto una parte degli esperti disponibili, contenendo il calcolo necessario.

La famiglia supporta una finestra di contesto fino a un milione di token, cioè la quantità di informazioni che il modello può considerare nella stessa elaborazione. L’addestramento per rinforzo condotto in più ambienti è rivolto ai workflow agentici complessi e di lunga durata, nei quali un agente deve mantenere il contesto mentre pianifica ed esegue una sequenza di attività.

Gemma 4 per agenti eseguiti localmente

La nuova famiglia Gemma 4 deriva dalla ricerca e dalle tecnologie sviluppate da Google DeepMind per Gemini 3 e comprende modelli aperti con pesi disponibili. Le capacità includono ragionamento multimodale, chiamata di funzioni e supporto a 140 lingue, con varianti progettate per differenti disponibilità di memoria e capacità di calcolo.

La convalida su VCF è rivolta alla creazione e all’esecuzione locale di agenti autonomi. Olivier Lacombe, Director of Product Management di Google DeepMind, associa l’impiego di Gemma 4 su VMware Cloud Foundation all’architettura Zero Trust della piattaforma e al supporto per il Model Context Protocol, lo standard che permette a modelli e agenti di collegarsi a dati e strumenti attraverso un’interfaccia comune.

cotomi, un modello specializzato per il giapponese

Ottimizzato per la lingua giapponese e addestrato su insiemi di dati selezionati, cotomi combina elaborazione ad alta velocità e un miglioramento dichiarato del 40% nell’efficienza dei token. Il modello proprietario di NEC può essere eseguito nell’ambiente del cliente o tramite NEC Private Infrastructure powered by VMware, il cloud privato ospitato nei data center NEC.

Qwen 3.7-Max con un milione di token di contesto

Modello proprietario di punta della famiglia Qwen di Alibaba Cloud, Qwen 3.7-Max offre una finestra di contesto da un milione di token ed è destinato a compiti che richiedono ragionamento avanzato e l’elaborazione di grandi quantità di informazioni nella stessa sessione.

L’esecuzione su VCF permette alle organizzazioni di utilizzare il modello on-premise e di conservarne sotto il proprio controllo dati, prompt e risultati. La convalida aggiunge Qwen all’insieme di modelli che possono essere offerti agli utenti interni attraverso i servizi integrati della piattaforma.

GLM 5.2 per programmazione e ragionamento in più fasi

Progettato per attività di lunga durata, programmazione, uso di strumenti e ragionamento articolato in più passaggi, GLM 5.2 rende disponibili i propri pesi per l’esecuzione locale e supporta runtime di inferenza tra i quali vLLM.

Su VMware Cloud Foundation può essere impiegato per agenti di programmazione e workflow autonomi in più fasi, mantenendo localmente il modello e i dati utilizzati. La configurazione è rivolta alle organizzazioni che devono coniugare la sovranità delle informazioni con l’impiego di hardware dedicato all’inferenza.

Sovranità dei dati e servizi gestiti

La convalida riguarda anche l’uso dei modelli da parte di cloud provider e fornitori di servizi. ThinkOn utilizza VMware Cloud Foundation per offrire un framework di AI sovrana nel quale i clienti mantengono il controllo della proprietà intellettuale e applicano i requisiti di governance e conformità del proprio settore.

Craig McLellan, CEO di ThinkOn, distingue la sovranità dalla sola residenza del dato: l’ubicazione fisica rappresenta una parte del requisito, mentre la sovranità comprende il controllo della proprietà intellettuale e l’applicazione delle regole di governance e conformità. I modelli convalidati possono così essere erogati come servizi di inferenza pronti per la produzione su un cloud privato gestito, conservando i vincoli operativi e normativi dell’organizzazione.

Se questo articolo ti è piaciuto e vuoi rimanere sempre informato sulle novità tecnologiche

LASCIA UN COMMENTO

Inserisci il tuo commento
Inserisci il tuo nome