Cosa è uscito oggi
Anthropic ha rilasciato Claude Sonnet 5.5, secondo modello della generazione 5.5 dopo Opus 5.5 del 22 settembre. Sei giorni tra un modello di punta e il suo fratello economico: è il ritmo a cui va questo mercato.
Sull'API si chiama claude-sonnet-5-5 ed è disponibile subito su tutte le piattaforme, incluse Amazon Web Services, Google Cloud e Microsoft Azure, oltre che dentro claude.ai e Claude Code. Un milione di token di contesto, 128.000 di output massimo, conoscenza affidabile a giugno 2026.
Il posizionamento dichiarato è il complemento veloce di Opus 5.5: compiti ben definiti, correzione di bug, documenti, presentazioni e fogli di calcolo rifiniti. Anthropic rivendica anche una particolare attitudine al design.
Poi ci sono i numeri, e uno in particolare non sta al suo posto.
Il numero che scavalca il modello di punta
Su Terminal-Bench 4.0, la valutazione di coding agentico, Sonnet 5.5 segna 70,6%. Opus 5.5, che costa il doppio in ingresso e in uscita, si ferma al 66,4%.
Un modello di fascia media che passa davanti al modello di punta sul test più citato del mese non è normale, e vale la pena capire perché prima di riscrivere le proprie architetture. Il punteggio di Opus 5.5 è dichiarato a effort xhigh, quindi non è un confronto a parità di configurazione. E Terminal-Bench misura una cosa sola: task agentici da terminale, portati a termine senza aiuto. Non misura la qualità di un'analisi o la tenuta su un ragionamento lungo.
Sugli altri test la gerarchia torna quella attesa, ma con distanze piccole. Sul knowledge work di GDPval-AA v2.1, Sonnet 5.5 segna 1844 punti Elo contro i 1846 di Opus 5.5: due punti. Su AA-Briefcase 1811 contro 1822. Su Humanity's Last Exam con strumenti, 64,5% contro 67,7%. Su OSWorld 2.1, 80,1% contro 81,8%. Su FrontierCode, dove il ragionamento pesa di più, il distacco si allarga: 46,2% contro 54,4%.
Il confronto con il predecessore è dichiarato più ampio, in alcuni casi in modo sospetto: Anthropic riporta Sonnet 5 al 10,3% su Terminal-Bench 4.0, un valore così basso da far pensare più ai limiti del modello precedente dentro quello specifico harness che a un salto generazionale di sessanta punti. Su test meno estremi il progresso resta comunque netto: Chartography dal 15,6% al 61,6%, CursorBench dal 34,1% al 55,5%, knowledge work da 1449 a 1844 punti.
Prezzo fermo, costo per compito in calo
Il listino non si muove: 2$ per milione di token in ingresso e 10$ in uscita, esattamente come Sonnet 5. La lettura della cache costa 0,20$ e la scrittura 2,50$.
Quello che cambia è quanto serve per finire un lavoro. Anthropic dichiara output più veloci del 30% e fino al 30% di costo in meno per compito, con la motivazione che conta più della velocità: il modello chiude gli stessi compiti con meno chiamate agli strumenti. Su un agente che gira in produzione, meno passaggi significa meno contesto riletto, quindi meno token pagati due volte.
Un dettaglio tecnico con effetti pratici: la soglia minima per mettere in cache un prompt scende da 1.024 a 512 token. Prompt di sistema corti, che prima non venivano mai messi in cache, ora lo sono.
E c'è la parte gratis: Sonnet 5.5 è il modello predefinito dentro claude.ai e Claude Code, quindi chi usa Claude senza toccare l'API si ritrova il modello nuovo senza fare niente.
Vuoi capire se Sonnet 5.5 basta per i tuoi processi?
30 minuti per discutere il tuo caso specifico.
Il ragionamento non si spegne più, si sposta
Su Sonnet 5 si poteva disattivare il ragionamento impostando thinking disabled, per andare più veloci su compiti banali. Su Sonnet 5.5 quell'impostazione restituisce un errore 400.
Al suo posto arriva between_tools, il livello di ragionamento più basso: niente ragionamento iniziale, ma le note di avanzamento tra una chiamata e l'altra tornano comunque come brevi riassunti. Funziona su tutte le piattaforme, senza intestazioni beta, ed è accettato a effort low, medium e high. A xhigh e max restituisce errore: lì serve il ragionamento adattivo.
Una conseguenza da conoscere prima di usarlo: con between_tools l'effort non si può cambiare a metà conversazione.
L'altro cambiamento silenzioso riguarda l'interfaccia. Le note che il modello scrive tra le chiamate agli strumenti, se sono più lunghe di una frase o due, non tornano più come testo ma come blocchi di ragionamento, vuoti con l'impostazione predefinita. Nessuna richiesta fallisce, ma un'interfaccia che mostrava quei messaggi di avanzamento all'utente smette di mostrare qualcosa.
Le altre cose che si rompono
Chi arriva da Sonnet 5 trova la stessa lista già vista su Opus 5.5.
L'uso forzato degli strumenti non c'è più: tool_choice impostato su any o su tool restituisce 400. Va usato auto, con gli strumenti dichiarati in modalità strict e un'istruzione chiara nel prompt su quando chiamarli. Su Amazon Bedrock la modalità strict non è disponibile per questo modello, quindi lì la validazione va fatta nel proprio codice.
I blocchi di ragionamento sono legati al modello e all'account. Sonnet 5.5 legge quelli di Sonnet 5 e dei modelli precedenti, ma non quelli di Opus 5, Opus 5.5 o della famiglia Fable: l'API li scarta senza errore. Per gli account creati dal 31 agosto 2026 in poi, riscrivere un turno già avvenuto e poi rimandare indietro un blocco di ragionamento restituisce 400. Le conversazioni vanno tenute in sola aggiunta.
L'uso del computer richiede il nuovo toolset su API Claude e Google Cloud.
E i rifiuti aumentano di categoria: è il primo Sonnet a nascere con i safeguard di cybersecurity che prima erano riservati a Opus, più le categorie su biologia, sviluppo di modelli concorrenti ed estrazione del ragionamento interno. Un rifiuto arriva con stato 200 e stop_reason impostato su refusal, quindi va gestito: il codice che legge il contenuto senza controllare quel campo vede una risposta vuota.
Perché per un'azienda questo conta più di Opus 5.5
Perché sposta il punto di partenza.
Fino a ieri la regola sensata era: Sonnet per il volume, Opus per i compiti critici. Con due punti Elo di differenza sul knowledge work e un quinto del prezzo, la domanda si ribalta. Non è più quando usare Sonnet, è cosa giustifica di non usarlo.
La risposta esiste e resta valida per una minoranza di casi: compiti lunghi e poco supervisionati, ragionamento profondo su documenti complessi, agenti che lavorano per ore senza nessuno a controllarli. Lì il distacco su FrontierCode, otto punti, dice che il modello di punta serve ancora.
Per tutto il resto, cioè la maggior parte del lavoro d'ufficio reale, il modello da provare per primo è questo. Su come si imposta il ragionamento senza tirare a indovinare ho scritto il confronto tra Opus 5.5 e Sonnet 5.5, e sulla struttura del conto complessivo resta valido quanto costa Claude in azienda.
Una raccomandazione che Anthropic fa e che di solito viene ignorata: rifare la calibrazione dell'effort. I livelli sono stati ritarati, il valore predefinito su API è high, e per il lavoro agentico ben specificato la raccomandazione è partire da medium. Un pomeriggio di prove su richieste vere vale più di qualsiasi tabella di benchmark, compresa quella qui sopra.