Due rilasci in sei giorni
Il 22 settembre è uscito Claude Opus 5.5, il 28 Claude Sonnet 5.5. Sei giorni.
Per chi deve prendere una decisione tecnica, il problema non è la velocità dei rilasci ma il fatto che il confronto tradizionale non funziona più. La regola che tutti usavano, modello di punta per le cose serie e modello medio per il volume, presupponeva un divario ampio. Su questa generazione il divario, su buona parte dei compiti, si misura in decimali.
I due modelli sulla carta
Opus 5.5 costa 4$ per milione di token in ingresso e 20$ in uscita. Sonnet 5.5 costa 2$ e 10$: esattamente la metà.
Il resto delle caratteristiche coincide. Un milione di token di contesto, 128.000 di output massimo, conoscenza affidabile a giugno 2026, ragionamento adattivo, disponibilità su API Claude, Amazon Bedrock, Google Cloud e Microsoft Foundry. La lettura della cache costa 0,20$ per milione su entrambi, che in proporzione al prezzo di ingresso conviene di più su Opus.
Una differenza va segnata perché falsa qualsiasi confronto fatto in fretta: l'effort predefinito. Su Opus 5.5 è medium, su Sonnet 5.5 è high. Chi mette i due modelli uno accanto all'altro senza toccare niente sta confrontando il modello di punta a metà sforzo con quello medio a sforzo alto. È il modo più rapido per arrivare alla conclusione sbagliata, in una direzione o nell'altra.
Dove i benchmark li separano davvero
Sui test pubblicati da Anthropic il quadro è questo.
Sul knowledge work, GDPval-AA v2.1, Opus 5.5 segna 1846 punti Elo e Sonnet 5.5 ne segna 1844. Due punti. Su AA-Briefcase, 1822 contro 1811.
Sul coding agentico da terminale, Terminal-Bench 4.0, Sonnet 5.5 sta sopra: 70,6% contro 66,4%. Il punteggio di Opus è misurato a effort xhigh, quindi non è un confronto simmetrico, ma resta il fatto che il modello che costa la metà non perde su quel test.
Dove la gerarchia si vede è il ragionamento. Su FrontierCode v1.1 Opus 5.5 segna 54,4% contro il 46,2% di Sonnet 5.5: otto punti, il distacco più ampio della tabella. Su Humanity's Last Exam con strumenti, 67,7% contro 64,5%.
Tradotto: sui compiti dove il lavoro consiste nell'eseguire bene qualcosa di ben definito, i due modelli si equivalgono. Sui compiti dove il lavoro consiste nel capire cosa fare, il modello di punta è ancora il modello di punta.
Non sai quale modello conviene ai tuoi processi?
30 minuti per discutere il tuo caso specifico.
Quando il doppio prezzo si ripaga
Il prezzo per token non è il costo. Il costo è quanto spendi per portare a termine un compito, e su quello incidono tre cose che non compaiono nel listino.
Quante volte devi rifare il lavoro. Un modello che sbaglia un'analisi su cinque costa molto più della differenza di listino, se qualcuno deve controllare tutte e cinque.
Quanto contesto rilegge. Negli agenti la voce dominante sono i token riletti dalla cache a ogni passo. Opus 5.5 legge la cache a 0,20$ su un prezzo base di 4$, cioè il 5%, mentre su Sonnet 5.5 quello stesso 0,20$ vale il 10% del prezzo base. Su carichi molto agentici il rapporto tra i due modelli si stringe rispetto a quello che suggerisce il listino.
Quanti passaggi servono. Anthropic dichiara per Sonnet 5.5 meno chiamate agli strumenti a parità di compito, che è un risparmio composto: meno passaggi, meno contesto riletto, meno tempo.
La regola pratica che ne esce: Opus 5.5 si ripaga sui compiti lunghi, poco supervisionati e ad alto valore unitario, dove un errore costa più della differenza di prezzo. Sonnet 5.5 vince su tutto il resto, cioè sulla stragrande maggioranza del lavoro d'ufficio.
La regola che usiamo nei progetti
Nei progetti che costruiamo non scegliamo un modello, ne instradiamo diversi.
Haiku per classificazione, estrazione e instradamento: compiti dove la differenza di qualità non si vede e il volume è alto.
Sonnet 5.5 come predefinito per tutto il lavoro applicativo: sintesi, generazione, analisi di documenti, agenti su volume, correzione di codice.
Opus 5.5 sui compiti che si riconoscono da tre segnali: durano a lungo, nessuno li controlla mentre girano, e sbagliare costa. Analisi documentali profonde, agenti autonomi su processi critici, decisioni che poi qualcuno firma.
Fable 5.1 resta sopra a tutti sui carichi estremi, a 10$ e 50$ per milione di token, e ha senso solo quando le prove su Opus 5.5 ad effort alto non bastano ancora.
Questo non è un principio di architettura elegante, è aritmetica: il costo medio per richiesta crolla e la qualità resta dove serve. Ne ho scritto più in dettaglio nel confronto tra Sonnet, Opus e Haiku.
Come si decide senza tirare a indovinare
Il metodo è meno sofisticato di quanto si pensi, e quasi nessuno lo applica.
Si prendono venti o trenta richieste vere, prese dal lavoro dell'azienda e non inventate. Si definisce cosa vuol dire risposta accettabile, in modo che due persone diverse diano lo stesso giudizio. Si fanno girare su Sonnet 5.5 a effort medium e high, e su Opus 5.5 a medium e high. Si contano gli errori e si guarda il conto.
Nella maggior parte dei casi che abbiamo visto succede una cosa sola: il modello economico a effort alto pareggia il modello di punta a effort medio, e il divario si apre solo su una fascia di compiti riconoscibile, che a quel punto si può instradare per conto suo.
Un pomeriggio di lavoro, e la decisione smette di essere un'opinione. Vale per questa generazione e varrà per la prossima, che dai tempi di Anthropic arriverà tra poche settimane.
Con Maverick lavoriamo esattamente su questo: scegliere e calibrare i modelli sui carichi reali dell'azienda, non sui benchmark di chi li produce.