Le saut sur le coding, en chiffres
Opus 5 est, tel que le racontent les benchmarks, le modèle phare le plus fort sur le coding agentique. Sur SWE-bench Pro, il obtient 79,2% contre 69,2% pour Opus 4.8 : dix points. Pour l'échelle, Sonnet 5 sur le même test est à 63,2%, tandis que les modèles de frontière Fable 5 et Mythos 5 sont autour de 80%. Sur SWE-bench Verified, le score rapporté est encore plus élevé.
Une note de méthode, parce que les chiffres ne comptent que s'ils sont honnêtes : à part SWE-bench Verified, ces chiffres viennent de rapports de tiers dans les premiers jours après le lancement. L'ordre de grandeur est consolidé, les pourcentages individuels sont à prendre comme indicatifs tant que les évals officielles complètes ne sont pas sorties. S'il vous faut le tableau non technique, partez de ce qu'est Opus 5.
CursorBench et le coût par tâche
La donnée la plus intéressante pour qui développe n'est pas le pic de qualité, c'est le rapport qualité/coût. Sur CursorBench 3.2, à effort maximum, Opus 5 arrive à environ un demi-point de Fable 5 en payant moitié moins par tâche. Anthropic soutient en outre qu'aux niveaux d'effort élevé, xhigh et max, Opus 5 rend plus que tout autre modèle à coût égal.
Traduit pour une équipe dev : vous pouvez garder un modèle phare sur tout le flux — de la lecture du code au refactor au débogage — sans la facture d'électricité qui vous force à downgrader sur les tâches lourdes. C'est là que le nouveau modèle change les habitudes, pas seulement les benchmarks.
L'effort dial pour qui programme
L'effort dial est particulièrement utile dans le développement, où les tâches ont une difficulté très différente. Générer un test unitaire trivial et concevoir une migration de schéma complexe ne méritent pas le même budget de raisonnement.
Avec Opus 5, vous montez l'effort sur les tâches architecturales et le baissez sur le travail mécanique. Le résultat est un coût par session plus prévisible et, sur les tâches difficiles, plus d'itérations de vérification avant de déclarer terminé — Anthropic signale justement un modèle "meilleur pour vérifier son propre travail et itérer jusqu'à réussir". Pour qui fait tourner des agents en autonomie, c'est la différence entre un agent qui livre et un qui s'arrête à mi-chemin.
Vous voulez mettre Opus 5 au travail sur votre code ?
30 minutes pour discuter de votre cas spécifique.
Les deux bêtas API qui comptent
En même temps qu'Opus 5, Anthropic a livré deux fonctions bêta pensées pour qui construit des agents sur l'API.
La première : changement des outils en milieu de conversation sans invalider le cache du prompt. Un agent peut acquérir ou perdre des tools en cours de route — par exemple débloquer l'accès à une base de données seulement après un check — sans repayer tout le contexte. Sur les flux longs, c'est une économie réelle. La seconde : les fallbacks automatiques. Si une requête est bloquée par les classificateurs de sécurité, elle est routée vers un autre modèle disponible au lieu d'échouer. Moins d'erreurs non gérées en production. Ce sont les finitions qui séparent un prototype d'un agent qui tient le trafic réel. Pour les fondations, voyez le guide sur Agent SDK et agents autonomes.
Ce qui change dans Claude Code
Dans Claude Code, l'outil en terminal d'Anthropic, Opus 5 devient le moteur recommandé pour le travail sérieux : plus fiable sur les tâches multi-fichiers, meilleur pour vérifier et corriger avant de clore, avec l'effort que vous pouvez monter quand il faut de la profondeur. Le mode Fast, plus rapide au double du prix, est pratique quand la latence gêne plus que le coût — typique des sessions interactives denses.
Pour une équipe qui travaille déjà dans Claude Code, l'upgrade ne demande de rien réécrire : le modèle change en dessous et vous remesurez. Si vous portez Claude Code ou les agents dans un contexte d'entreprise, avec contrôle sur les permissions et la sécurité, regardez Claude Code pour les entreprises.
L'upgrade en vaut-il la peine ?
Pour qui développe avec Claude, oui, presque toujours. Même prix catalogue qu'Opus 4.8, performances de coding nettement meilleures, contrôle du coût avec l'effort dial et deux bêtas qui enlèvent du frottement aux agents. La seule précaution : relancer ses propres tests et ses évals, parce qu'un nouveau modèle change les outputs et ce qui était réglé avant doit être revérifié.
Chez Maverick AI, nous construisons des agents et des intégrations avec Claude Code, Agent SDK et MCP, et nous les portons en production avec les contrôles nécessaires. Si vous voulez mettre Opus 5 au travail sur votre code ou vos agents, écrivez-nous.