News & Aggiornamenti8 min di letturaPubblicato il 2026-09-28

Claude Sonnet 5.5 batte Opus 5.5 sul coding agentico e costa un quinto

Il 28 settembre 2026 Anthropic ha rilasciato Claude Sonnet 5.5. Stesso prezzo di Sonnet 5, 30% di velocità in più e il punteggio più alto della famiglia su Terminal-Bench 4.0. Cosa cambia davvero per le aziende e cosa si rompe nel codice.

In sintesi

Sonnet 5.5 esce sei giorni dopo Opus 5.5 e mantiene il listino di Sonnet 5: 2$ e 10$ per milione di token. Anthropic dichiara output più veloci del 30% e fino al 30% di costo in meno per compito. Il numero che sorprende è Terminal-Bench 4.0, dove Sonnet 5.5 segna 70,6% e passa davanti a Opus 5.5 (66,4%), che costa il doppio. Sul knowledge work la distanza dal modello di punta è di due punti Elo su 1846. Nel codice cambia una cosa importante: thinking disabled non esiste più, al suo posto arriva between_tools.

Cosa è uscito oggi

Anthropic ha rilasciato Claude Sonnet 5.5, secondo modello della generazione 5.5 dopo Opus 5.5 del 22 settembre. Sei giorni tra un modello di punta e il suo fratello economico: è il ritmo a cui va questo mercato.

Sull'API si chiama claude-sonnet-5-5 ed è disponibile subito su tutte le piattaforme, incluse Amazon Web Services, Google Cloud e Microsoft Azure, oltre che dentro claude.ai e Claude Code. Un milione di token di contesto, 128.000 di output massimo, conoscenza affidabile a giugno 2026.

Il posizionamento dichiarato è il complemento veloce di Opus 5.5: compiti ben definiti, correzione di bug, documenti, presentazioni e fogli di calcolo rifiniti. Anthropic rivendica anche una particolare attitudine al design.

Poi ci sono i numeri, e uno in particolare non sta al suo posto.

Il numero che scavalca il modello di punta

Su Terminal-Bench 4.0, la valutazione di coding agentico, Sonnet 5.5 segna 70,6%. Opus 5.5, che costa il doppio in ingresso e in uscita, si ferma al 66,4%.

Un modello di fascia media che passa davanti al modello di punta sul test più citato del mese non è normale, e vale la pena capire perché prima di riscrivere le proprie architetture. Il punteggio di Opus 5.5 è dichiarato a effort xhigh, quindi non è un confronto a parità di configurazione. E Terminal-Bench misura una cosa sola: task agentici da terminale, portati a termine senza aiuto. Non misura la qualità di un'analisi o la tenuta su un ragionamento lungo.

Sugli altri test la gerarchia torna quella attesa, ma con distanze piccole. Sul knowledge work di GDPval-AA v2.1, Sonnet 5.5 segna 1844 punti Elo contro i 1846 di Opus 5.5: due punti. Su AA-Briefcase 1811 contro 1822. Su Humanity's Last Exam con strumenti, 64,5% contro 67,7%. Su OSWorld 2.1, 80,1% contro 81,8%. Su FrontierCode, dove il ragionamento pesa di più, il distacco si allarga: 46,2% contro 54,4%.

Il confronto con il predecessore è dichiarato più ampio, in alcuni casi in modo sospetto: Anthropic riporta Sonnet 5 al 10,3% su Terminal-Bench 4.0, un valore così basso da far pensare più ai limiti del modello precedente dentro quello specifico harness che a un salto generazionale di sessanta punti. Su test meno estremi il progresso resta comunque netto: Chartography dal 15,6% al 61,6%, CursorBench dal 34,1% al 55,5%, knowledge work da 1449 a 1844 punti.

Prezzo fermo, costo per compito in calo

Il listino non si muove: 2$ per milione di token in ingresso e 10$ in uscita, esattamente come Sonnet 5. La lettura della cache costa 0,20$ e la scrittura 2,50$.

Quello che cambia è quanto serve per finire un lavoro. Anthropic dichiara output più veloci del 30% e fino al 30% di costo in meno per compito, con la motivazione che conta più della velocità: il modello chiude gli stessi compiti con meno chiamate agli strumenti. Su un agente che gira in produzione, meno passaggi significa meno contesto riletto, quindi meno token pagati due volte.

Un dettaglio tecnico con effetti pratici: la soglia minima per mettere in cache un prompt scende da 1.024 a 512 token. Prompt di sistema corti, che prima non venivano mai messi in cache, ora lo sono.

E c'è la parte gratis: Sonnet 5.5 è il modello predefinito dentro claude.ai e Claude Code, quindi chi usa Claude senza toccare l'API si ritrova il modello nuovo senza fare niente.

Vuoi capire se Sonnet 5.5 basta per i tuoi processi?

30 minuti per discutere il tuo caso specifico.

Prenota una call

Il ragionamento non si spegne più, si sposta

Su Sonnet 5 si poteva disattivare il ragionamento impostando thinking disabled, per andare più veloci su compiti banali. Su Sonnet 5.5 quell'impostazione restituisce un errore 400.

Al suo posto arriva between_tools, il livello di ragionamento più basso: niente ragionamento iniziale, ma le note di avanzamento tra una chiamata e l'altra tornano comunque come brevi riassunti. Funziona su tutte le piattaforme, senza intestazioni beta, ed è accettato a effort low, medium e high. A xhigh e max restituisce errore: lì serve il ragionamento adattivo.

Una conseguenza da conoscere prima di usarlo: con between_tools l'effort non si può cambiare a metà conversazione.

L'altro cambiamento silenzioso riguarda l'interfaccia. Le note che il modello scrive tra le chiamate agli strumenti, se sono più lunghe di una frase o due, non tornano più come testo ma come blocchi di ragionamento, vuoti con l'impostazione predefinita. Nessuna richiesta fallisce, ma un'interfaccia che mostrava quei messaggi di avanzamento all'utente smette di mostrare qualcosa.

Le altre cose che si rompono

Chi arriva da Sonnet 5 trova la stessa lista già vista su Opus 5.5.

L'uso forzato degli strumenti non c'è più: tool_choice impostato su any o su tool restituisce 400. Va usato auto, con gli strumenti dichiarati in modalità strict e un'istruzione chiara nel prompt su quando chiamarli. Su Amazon Bedrock la modalità strict non è disponibile per questo modello, quindi lì la validazione va fatta nel proprio codice.

I blocchi di ragionamento sono legati al modello e all'account. Sonnet 5.5 legge quelli di Sonnet 5 e dei modelli precedenti, ma non quelli di Opus 5, Opus 5.5 o della famiglia Fable: l'API li scarta senza errore. Per gli account creati dal 31 agosto 2026 in poi, riscrivere un turno già avvenuto e poi rimandare indietro un blocco di ragionamento restituisce 400. Le conversazioni vanno tenute in sola aggiunta.

L'uso del computer richiede il nuovo toolset su API Claude e Google Cloud.

E i rifiuti aumentano di categoria: è il primo Sonnet a nascere con i safeguard di cybersecurity che prima erano riservati a Opus, più le categorie su biologia, sviluppo di modelli concorrenti ed estrazione del ragionamento interno. Un rifiuto arriva con stato 200 e stop_reason impostato su refusal, quindi va gestito: il codice che legge il contenuto senza controllare quel campo vede una risposta vuota.

Perché per un'azienda questo conta più di Opus 5.5

Perché sposta il punto di partenza.

Fino a ieri la regola sensata era: Sonnet per il volume, Opus per i compiti critici. Con due punti Elo di differenza sul knowledge work e un quinto del prezzo, la domanda si ribalta. Non è più quando usare Sonnet, è cosa giustifica di non usarlo.

La risposta esiste e resta valida per una minoranza di casi: compiti lunghi e poco supervisionati, ragionamento profondo su documenti complessi, agenti che lavorano per ore senza nessuno a controllarli. Lì il distacco su FrontierCode, otto punti, dice che il modello di punta serve ancora.

Per tutto il resto, cioè la maggior parte del lavoro d'ufficio reale, il modello da provare per primo è questo. Su come si imposta il ragionamento senza tirare a indovinare ho scritto il confronto tra Opus 5.5 e Sonnet 5.5, e sulla struttura del conto complessivo resta valido quanto costa Claude in azienda.

Una raccomandazione che Anthropic fa e che di solito viene ignorata: rifare la calibrazione dell'effort. I livelli sono stati ritarati, il valore predefinito su API è high, e per il lavoro agentico ben specificato la raccomandazione è partire da medium. Un pomeriggio di prove su richieste vere vale più di qualsiasi tabella di benchmark, compresa quella qui sopra.

FT
Federico Thiella·Founder, Maverick AI

Lavora con aziende italiane ed europee sull'adozione di Claude e dell'ecosistema Anthropic. Ha guidato implementazioni AI in private equity, consulenza, manifattura e servizi professionali.

LinkedIn

Vuoi capire se Sonnet 5.5 basta per i tuoi processi?

Aiutiamo le aziende italiane a scegliere e calibrare i modelli Claude sui carichi reali, non sui benchmark. Se stai valutando un'implementazione, parliamone.

Scrivici

Domande frequenti su Claude Sonnet 5.5

Due dollari per milione di token in ingresso e dieci in uscita, gli stessi prezzi di Sonnet 5. La lettura della cache costa 0,20$ per milione di token e la scrittura 2,50$. Le richieste in batch sono scontate del 50%. Anthropic dichiara comunque un costo per compito fino al 30% più basso, perché il modello chiude gli stessi lavori più in fretta e con meno chiamate agli strumenti.
Su un test sì, su quasi tutti gli altri no, ma di poco. Su Terminal-Bench 4.0, che misura il coding agentico, Sonnet 5.5 segna 70,6% contro il 66,4% di Opus 5.5, misurato però a effort xhigh. Sul knowledge work la distanza è di due punti Elo, 1844 contro 1846. Dove il divario resta ampio è il ragionamento profondo: su FrontierCode 46,2% contro 54,4%.
L'impostazione thinking disabled restituisce un errore 400. Al suo posto si usa thinking di tipo between_tools, che elimina il ragionamento iniziale e lascia solo le note di avanzamento tra le chiamate agli strumenti. È accettato a effort low, medium e high, ma non a xhigh o max, e con quella impostazione l'effort non può cambiare a metà conversazione.
Sì, se arrivi da Sonnet 5 ci sono quattro punti. L'uso forzato degli strumenti restituisce 400. Il ragionamento si spegne con between_tools e non più con disabled. I blocchi di ragionamento di Opus 5, Opus 5.5 e della famiglia Fable vengono scartati, e per gli account creati dal 31 agosto 2026 le conversazioni vanno tenute in sola aggiunta. L'uso del computer richiede il nuovo toolset su API Claude e Google Cloud.
No. Sonnet 5.5 è disponibile dentro le applicazioni Claude e dentro Claude Code fin dal lancio: chi non lavora con le API se lo ritrova senza configurare niente. I punti tecnici di questo articolo riguardano solo chi ha integrazioni che chiamano l'API direttamente.

Rimani informato sull'AI per il business

Ricevi aggiornamenti su Claude AI, casi d'uso aziendali e strategie di implementazione. Niente spam, solo contenuti utili.

Vuoi saperne di più?

Contattaci per scoprire come possiamo aiutare la tua azienda con soluzioni AI su misura.

System integrator specializzato su Claude AI in Italia. Lavoriamo con aziende in PE, pharma, fashion, manifattura e consulting.

Articoli correlati

News & Aggiornamenti

Claude Opus 5.5: il prezzo scende del 20%, e nell'aggiornamento c'è una trappola

Il 22 settembre 2026 Anthropic ha rilasciato Claude Opus 5.5. Input e output costano il 20% in meno di Opus 5, la lettura della cache il 60% in meno. I benchmark, i quattro breaking change e l'impostazione che cambia da sola quando aggiorni.

Guida

Opus 5.5 o Sonnet 5.5: due punti di differenza e il doppio del prezzo

In sei giorni Anthropic ha rilasciato Claude Opus 5.5 e Claude Sonnet 5.5. Prezzi, benchmark a confronto e una regola pratica per decidere quale usare senza tirare a indovinare.

Novità

Claude Sonnet 5: prestazioni da Opus a prezzo Sonnet — cosa cambia per le aziende

Anthropic ha rilasciato Claude Sonnet 5: più agentico, vicino a Opus 4.8 e più economico. Prezzi, prestazioni e cosa significa per chi usa l'AI in azienda.

News & Aggiornamenti

Claude Fable 5.1: la cache costa il 75% in meno e per gli agenti cambia il conto

Il 1 settembre 2026 Anthropic ha rilasciato Claude Fable 5.1 e Mythos 5.1. Cosa dicono i benchmark, perché il taglio del 75% sulla lettura della cache conta più dei benchmark e i tre breaking change API da sistemare prima di aggiornare.

Tecnico

Claude Sonnet vs Opus vs Haiku: quale modello usare

Haiku 4.5, Sonnet 5 e Opus 5 a confronto: prestazioni, prezzi 2026 e come scegliere il modello giusto per ogni caso aziendale.

Strategia

Quanto costa Claude AI per le aziende: pricing, piani e costi reali

Guida completa ai costi di Claude AI per le aziende. Pricing API per modello, piani enterprise, costi tipici di un progetto di integrazione e come ottimizzare la spesa.

Tecnico

Claude API: guida all'integrazione per sviluppatori

Guida tecnica completa all'integrazione di Claude API: setup, autenticazione, scelta del modello, gestione del contesto, rate limit e best practice per il deployment in produzione.

Prenota una call conoscitiva
Claude Sonnet 5.5: novità, benchmark e prezzi 2026 | Maverick AI