Claude Opus 5.5: agenti AI più autonomi, adaptive thinking e controlli su ogni azione

La competizione sull’AI di frontiera si concentra sempre più sul rapporto fra capacità, velocità e costo. Nelle stesse ore in cui OpenAI ha presentato GPT-6 Sol e GPT-6 Luna, Anthropic ha svelato Claude Opus 5.5, primo modello della nuova famiglia Claude 5.5 e nuova proposta di riferimento dell’azienda per il coding agentico, l’uso del computer e il knowledge work. I due annunci rendono immediato il confronto su efficienza e sostenibilità economica dei sistemi destinati ad agenti e attività professionali complesse.

Secondo i test di Anthropic, alle impostazioni predefinite Opus 5.5 comporta un costo medio per carico di lavoro inferiore del 40% rispetto a Opus 5 e produce output oltre il 30% più velocemente. Il vantaggio economico deriva sia dalla riduzione delle tariffe per token sia da un impiego più contenuto di token e passaggi per completare un’attività.

Prezzi più bassi e un milione di token di contesto

Sulla Claude Platform, l’input costa 4 dollari per milione di token e l’output 20 dollari, contro i 5 e 25 dollari di Opus 5. Le letture dalla prompt cache scendono da 0,50 a 0,20 dollari per milione di token, mentre le scritture in cache passano da 6,25 a 5 dollari. Per chi privilegia la velocità, la modalità Fast disponibile in Claude Code e sulla piattaforma API può generare risposte fino a 2,5 volte più rapidamente, con tariffe di 8 dollari per l’input e 40 dollari per l’output.

Opus 5.5 gestisce una finestra di contesto da un milione di token e un output massimo di 128.000 token. Il modello accetta testo e immagini, supporta l’uso di strumenti e adotta l’adaptive thinking sempre attivo, con livello di effort medio come impostazione predefinita. L’identificativo per le API è claude-opus-5-5.

Anthropic ha inoltre aumentato i limiti di utilizzo su cinque ore per gli abbonamenti Pro, Max, Team ed Enterprise basati su postazione. Agli utenti in abbonamento viene assegnato anche un reset del limite, che può essere conservato e utilizzato quando necessario.

Coding agentico e attività di lunga durata

Il coding è il principale ambito applicativo messo in evidenza nell’annuncio. Anthropic descrive Opus 5.5 come più adatto alle migrazioni che interessano interi codebase, agli audit e alle sessioni autonome prolungate. In un test interno, il modello ha completato la traduzione di HAProxy da C a Rust in 9,5 ore, contro le 12 ore attribuite a Claude Fable 5.1, con un costo inferiore del 51%; entrambe le riscritture hanno superato quasi tutti i test di regressione del progetto.

Nei benchmark pubblicati dall’azienda, Opus 5.5 ottiene il 66,4% in Terminal-Bench 4.0, il 54,4% nel set principale di FrontierCode 1.1 e il 57,8% in CursorBench 4.0. I risultati richiedono una lettura attenta: le prove non impiegano sempre lo stesso livello di effort e, per alcuni concorrenti, Anthropic riporta dati pubblicati dai rispettivi produttori. La stessa società osserva che, raggiunti questi livelli di capacità, margini ridotti nei benchmark descrivono in modo meno affidabile le differenze nel lavoro reale.

Le valutazioni dei clienti in accesso anticipato offrono indicazioni sull’efficienza nelle implementazioni concrete. Yashodha Bhavnani, vicepresidente AI Products di Box, riferisce: “Nei nostri test, Claude Opus 5.5 ha usato un terzo dei token impiegati da Opus 5 e le sue risposte sono state più concise del 40%, senza perdere accuratezza. Ci aspettiamo che questo abbia un peso rilevante per i team che eseguono agenti sui propri contenuti in settori come i servizi finanziari e la pubblica amministrazione”.

Dall’analisi finanziaria alla ricerca documentale

Opus 5.5 è destinato anche ai flussi professionali che combinano ricerca, analisi e produzione di documenti. In una prova interna su una fusione aziendale fittizia, il modello ha costruito un modello finanziario in Excel e una presentazione per i dirigenti in 63 minuti, rispetto ai 93 minuti di Opus 5, con un costo inferiore del 50%. Nel benchmark GDPval-AA 2.1, dedicato ad attività reali distribuite su 44 professioni, ha raggiunto 1.846 punti Elo al livello massimo di effort.

Anthropic segnala anche una maggiore chiarezza della scrittura: le risposte collocano prima le informazioni decisive, ricorrono meno al gergo e seguono con maggiore precisione le istruzioni stilistiche. È un miglioramento funzionale alle sessioni prolungate, nelle quali la leggibilità delle motivazioni, dei cambiamenti e delle richieste di intervento umano contribuisce alla verificabilità del lavoro svolto dall’agente.

Sicurezza per agenti che operano a lungo

La maggiore autonomia rende centrali i meccanismi di controllo. Opus 5.5 sottopone ogni azione a un classificatore prima dell’esecuzione e affianca a questo controllo una sandbox open source e strumenti di code review. Anthropic afferma inoltre che il modello eguaglia o supera Opus 5 nei test contro la prompt injection condotti su coding, uso di strumenti, controllo del computer e navigazione web.

Nell’audit comportamentale automatizzato di Anthropic, composto da quasi 2.000 scenari, il modello ha ottenuto i migliori risultati fra le versioni recenti di Claude su quasi tutte le misure relative ai comportamenti disallineati. In una nuova valutazione sui tentativi di oltrepassare i confini dell’ambiente di esecuzione, Opus 5.5 avrebbe cercato di aggirarli circa l’85% meno spesso di Opus 5 e Claude Mythos 5.1. L’azienda riconosce tuttavia nella propria System Card che costruire test capaci di intercettare ogni possibile errore prima della distribuzione resta un problema irrisolto e che il modello sembra talvolta riconoscere di essere sottoposto a valutazione.

Per cybersecurity e biologia Anthropic applica salvaguardie analoghe a quelle di Claude Fable 5.1. Le normali attività di individuazione e correzione dei bug restano accessibili, mentre gran parte delle richieste di sicurezza informatica viene reindirizzata a Opus 4.8; per gli operatori verificati è prevista un’estensione del Cyber Verification Program. Le organizzazioni accreditate nelle scienze della vita possono invece richiedere l’accesso al Life Sciences Verification Program.

Il modello adotta inoltre il preserved thinking, una protezione contro gli attacchi di distillazione che vincola i blocchi di ragionamento al contesto nel quale sono stati generati. La documentazione tecnica avverte gli sviluppatori che le integrazioni devono mantenere invariati il prompt di sistema, gli strumenti e i messaggi precedenti: modificare il prefisso di una conversazione può invalidare i blocchi di thinking già prodotti.

Claude Opus 5.5 è disponibile su Claude, Claude Code e Claude Platform, oltre che attraverso Amazon Web Services, Google Cloud e Microsoft Azure. Supporta la conservazione zero dei dati e include le misure di watermarking adottate da Anthropic per la conformità all’AI Act europeo. Claude Sonnet 5.5 e Claude Haiku 5.5 seguiranno nelle prossime settimane, estendendo alla restante gamma gli interventi su prestazioni, efficienza e sicurezza introdotti con Opus 5.5.

Se questo articolo ti è piaciuto e vuoi rimanere sempre informato sulle novità tecnologiche

LASCIA UN COMMENTO

Inserisci il tuo commento
Inserisci il tuo nome