La différence en une phrase
Même prix, plus de capacité, plus de contrôle sur le coût. Opus 5 coûte comme Opus 4.8 — 5$ par million de tokens en entrée, 25$ en sortie — mais rend davantage sur presque tous les terrains et ajoute un levier qui n'existait pas avant : l'effort dial.
Si vous avez deux minutes et utilisez déjà Opus 4.8, la réponse courte est : passez. Ci-dessous, les chiffres et les quelques points à vérifier avant. Si en revanche vous partez de zéro, mieux vaut lire d'abord ce qu'est Opus 5.
Les chiffres en comparaison
Sur le coding agentique, le terrain qui pèse le plus aujourd'hui, le saut est net. Sur SWE-bench Pro, Opus 5 obtient 79,2% contre 69,2% pour Opus 4.8 : dix points pleins. Pour donner l'échelle, Sonnet 5 sur le même test est à 63,2%. Sur ARC-AGI 3, le benchmark sur les problèmes jamais vus, Opus 5 distance le peloton d'environ trois fois.
Sur le front sécurité aussi il y a une amélioration : Anthropic qualifie Opus 5 de son Opus "le plus aligné", avec le score le plus bas sur l'audit comportemental interne. Pour qui met des agents en production, ce n'est pas un détail : c'est moins de surface de risque. (Les chiffres de benchmark au-delà de SWE-bench Verified proviennent de rapports de tiers dans les premiers jours après le lancement ; l'ordre de grandeur est consolidé, les chiffres individuels sont à prendre comme indicatifs.)
L'effort dial change l'économie
La comparaison sur le catalogue ne raconte que la moitié de l'histoire. L'autre moitié, c'est combien vous dépensez vraiment pour boucler une tâche. Ici, Opus 5 introduit l'effort dial : une molette qui règle combien faire raisonner le modèle.
Avec Opus 4.8, vous payiez la pleine puissance sur chaque appel. Avec Opus 5, vous montez l'effort là où la tâche est difficile et vous le baissez là où une réponse rapide suffit, en gardant l'essentiel de la qualité et en consommant moins de tokens. Résultat : à prix catalogue égal, le coût moyen par tâche baisse. C'est la raison principale pour laquelle la comparaison n'est pas "pareil qu'avant mais un peu mieux", mais un changement d'équation.
Vous voulez revoir votre mix de modèles après Opus 5 ?
30 minutes pour discuter de votre cas spécifique.
Quand il vaut la peine de passer (et quand attendre)
Il vaut la peine de passer tout de suite si : vous utilisez déjà Opus 4.8 en production, vous faites tourner des agents, ou vous avez des flux où le coût par tâche compte. Même prix, meilleur rendement, plus de contrôle. Il n'y a presque aucune raison de rester en arrière.
Il est logique de bouger plus calmement seulement si vous avez des pipelines très réglés et validés sur Opus 4.8, avec des évaluations automatiques que vous ne pouvez pas relancer rapidement. Dans ce cas, ce n'est pas "ne passez pas", c'est "passez après avoir relancé vos évals". Le nouveau modèle change les réponses : ce qui était réglé avant doit être revérifié, pas tenu pour acquis.
Quoi revoir dans votre configuration
Deux choses, concrètes. Premièrement, le routage des modèles. Avec l'effort dial, vous pouvez déplacer sur Opus 5 (à effort bas) des tâches que vous confiiez avant à un modèle plus petit pour économiser. Refaites le calcul : vous pourriez simplifier l'architecture et élever la qualité au même coût.
Deuxièmement, les agents en production. Opus 5 à effort élevé boucle des tâches qu'Opus 4.8 échouait ; à effort bas, il vous fait économiser sur les simples. Remesurez le taux de réussite et le coût par tâche sur vos flux réels, pas sur les benchmarks publics. Et si vous utilisez l'API, évaluez les deux nouvelles bêtas — changement d'outils en milieu de conversation et fallbacks automatiques — qui réduisent coûts et interruptions. On en parle dans Opus 5 pour le coding.
Le tableau complet des modèles
Opus 5 ne vit pas seul : il s'imbrique avec Sonnet 5 pour le volume et avec les modèles de frontière pour les tâches extrêmes. Si vous redessinez votre stratégie de modèles, le point n'est pas "quel est le meilleur" mais "quelle tâche à quel modèle, à quel effort". Pour une vue d'ensemble à jour, regardez Sonnet, Opus et Haiku comparés et la deep-dive sur les modèles Claude.
Chez Maverick AI, nous aidons les entreprises à faire exactement ce choix, sans s'attacher à un modèle. Si vous voulez revoir votre mix après Opus 5, écrivez-nous.