Il salto sul coding, in numeri
Opus 5 è, per come lo raccontano i benchmark, il modello di punta più forte sul coding agentico. Su SWE-bench Pro segna 79,2% contro il 69,2% di Opus 4.8: dieci punti. Per scala, Sonnet 5 sullo stesso test sta a 63,2%, mentre i modelli di frontiera Fable 5 e Mythos 5 stanno intorno all'80%. Su SWE-bench Verified il punteggio riportato è ancora più alto.
Una nota di metodo, perché i numeri contano solo se sono onesti: a parte SWE-bench Verified, queste cifre vengono da report di terze parti nei primi giorni dopo il lancio. L'ordine di grandezza è consolidato, le singole percentuali vanno prese come indicative finché non escono le eval ufficiali complete. Se ti serve il quadro non tecnico, parti da cos'è Opus 5.
CursorBench e il costo per task
Il dato più interessante per chi sviluppa non è il picco di qualità, è il rapporto qualità/costo. Su CursorBench 3.2, a effort massimo, Opus 5 arriva a circa mezzo punto da Fable 5 pagando metà del costo per task. Anthropic sostiene inoltre che, ai livelli di effort alto, xhigh e max, Opus 5 rende più di ogni altro modello a parità di costo.
Tradotto per un team dev: puoi tenere un modello di punta sull'intero flusso — dalla lettura del codice al refactor al debug — senza il conto della luce che ti costringe a downgradare sui task pesanti. È qui che il modello nuovo cambia le abitudini, non solo i benchmark.
L'effort dial per chi programma
L'effort dial è particolarmente utile nello sviluppo, dove i task hanno difficoltà molto diversa. Generare un test unitario banale e progettare una migrazione di schema complessa non meritano lo stesso budget di ragionamento.
Con Opus 5 alzi l'effort sui task architetturali e lo abbassi sul lavoro meccanico. Il risultato è un costo per sessione più prevedibile e, sui task difficili, più iterazioni di verifica prima di dichiarare fatto — Anthropic segnala proprio un modello "più bravo a verificare il proprio lavoro e a iterare finché non riesce". Per chi fa girare agenti in autonomia, è la differenza tra un agente che consegna e uno che si ferma a metà.
Vuoi mettere Opus 5 al lavoro sul tuo codice?
30 minuti per discutere il tuo caso specifico.
Le due beta API che contano
Insieme a Opus 5, Anthropic ha spedito due funzioni beta pensate per chi costruisce agenti sull'API.
La prima: cambio degli strumenti a metà conversazione senza invalidare la cache del prompt. Un agente può acquisire o perdere tool in corsa — per esempio sbloccare l'accesso a un database solo dopo un check — senza ripagare tutto il contesto. Su flussi lunghi è un risparmio reale. La seconda: fallback automatici. Se una richiesta viene bloccata dai classificatori di sicurezza, viene instradata su un altro modello disponibile invece di fallire. Meno errori non gestiti in produzione. Sono le rifiniture che separano un prototipo da un agente che regge il traffico vero. Per le fondamenta, vedi la guida su Agent SDK e agenti autonomi.
Cosa cambia in Claude Code
In Claude Code, lo strumento da terminale di Anthropic, Opus 5 diventa il motore consigliato per il lavoro serio: più affidabile sui task multi-file, migliore nel verificare e correggere prima di chiudere, con l'effort che puoi alzare quando serve profondità. La modalità Fast, più veloce al doppio del prezzo, è comoda quando la latenza dà fastidio più del costo — tipico delle sessioni interattive fitte.
Per un team che già lavora in Claude Code, l'upgrade non richiede riscrivere nulla: cambia il modello sotto e rimisura. Se stai portando Claude Code o gli agenti in un contesto aziendale, con controllo su permessi e sicurezza, guarda Claude Code per le aziende.
Vale l'upgrade?
Per chi sviluppa con Claude, sì, quasi sempre. Stesso prezzo di listino di Opus 4.8, prestazioni di coding nettamente migliori, controllo del costo con l'effort dial e due beta che tolgono attrito agli agenti. L'unica accortezza: ri-eseguire i propri test e le proprie eval, perché un modello nuovo cambia gli output e quello che era tarato prima va ri-verificato.
Con Maverick AI costruiamo agenti e integrazioni con Claude Code, Agent SDK e MCP, e li portiamo in produzione con i controlli che servono. Se vuoi mettere Opus 5 al lavoro sul tuo codice o sui tuoi agenti, scrivici.