L'illustration officielle d'Anthropic pour Claude Opus 4.8 : une main dessinée qui tient une structure de nœuds reliés, sur fond terracotta.

Claude Opus 4.8 : la revue — le meilleur rapport qualité-prix de la gamme, sauf sur un point

Attends. Tout le monde a parlé de Fable 5, sorti deux semaines plus tard, et Opus 4.8 est passé sous le radar. C’est une erreur. Anthropic a sorti Opus 4.8 le 28 mai 2026, et à l’usage, c’est probablement le modèle que tu devrais utiliser par défaut — pas Fable 5. On l’a fait tourner sur nos mandats agentiques depuis le lancement. Voici pourquoi, et le seul endroit où il se fait planter.

Ce qui s’est passé

Pas de nouvelle famille, pas de grand récit. Opus 4.8 est une montée de version dans la ligne Opus, deux crans après Opus 4.7. Anthropic l’a livré à prix identique à son prédécesseur, disponible via l’API sous l’identifiant claude-opus-4-8.

Le pitch d’Anthropic tient en deux mots : agents et honnêteté. C’est le modèle qu’ils poussent pour les workflows agentiques longs — Claude Code qui orchestre des centaines de sous-agents en parallèle, le contrôle d’ordinateur, les tâches multi-étapes qui touchent à de vrais outils. Et c’est le premier Opus qu’ils vendent d’abord sur sa fiabilité, pas sur sa puissance brute.

Deux semaines plus tard, Fable 5 est arrivé et a aspiré toute l’attention avec son statut de « modèle le plus capable ». Sauf que Fable 5 coûte le double et embarque des garde-fous qui le font basculer sur… Opus 4.8, justement, dès que ça touche au cyber ou à la bio. Autrement dit : une bonne partie du temps, payer Fable 5 te donne du Opus 4.8. Raison de plus pour regarder Opus 4.8 en face.

Les benchmarks officiels, sans filtre

Anthropic a publié son tableau comparatif le jour du lancement. Le voici tel quel.

Tableau de benchmarks officiel d'Anthropic comparant Claude Opus 4.8 à Opus 4.7, GPT-5.5 et Gemini 3.1 Pro sur le codage agentique, le codage terminal, le raisonnement, l'usage d'ordinateur, le travail de connaissance et l'analyse financière.
Le tableau officiel d'Anthropic. Opus 4.8 (colonne surlignée) est en tête partout, sauf une ligne : le codage terminal, où c'est GPT-5.5 qui est surligné. · Source : Anthropic

Lis-le côté opérateur, pas concours académique.

Sur le codage agentique (SWE-Bench Pro), Opus 4.8 sort 69,2 %, contre 64,3 % pour Opus 4.7, 58,6 % pour GPT-5.5 et 54,2 % pour Gemini 3.1 Pro. C’est plus de dix points d’avance sur GPT-5.5 sur le benchmark de codage le plus suivi. C’est réel, et c’est ce que tu sens sur les gros refactors.

Sur le raisonnement multidisciplinaire (Humanity’s Last Exam), il mène aussi : 49,8 % sans outils et 57,9 % avec outils, devant tout le monde dans les deux colonnes.

Sur le travail de connaissance (GDPval-AA), l’écart est net : 1890, contre 1753 pour Opus 4.7 et 1769 pour GPT-5.5. Gemini 3.1 Pro décroche loin derrière à 1314.

Sur l’usage d’ordinateur (OSWorld-Verified), 83,4 % — mais ici l’avance sur Opus 4.7 (82,8 %) est mince. Le vrai gain computer-use est ailleurs : Anthropic annonce 84 % sur Online-Mind2Web, où il se décrit comme son modèle d’agent-navigateur le plus fort à ce jour. Sur l’analyse financière (Finance Agent v2), 53,9 %, encore en tête mais serré face à GPT-5.5 (51,8 %).

Le point faible : le codage en terminal

Une ligne du tableau ne va pas dans le sens d’Opus 4.8, et Anthropic ne l’a pas cachée : le codage agentique en terminal (Terminal-Bench 2.1).

Concrètement : si ton workflow, c’est un agent qui vit dans le terminal et enchaîne des commandes shell en autonomie, GPT-5.5 a un léger avantage mesuré. Pour tout le reste du codage — comprendre un dépôt, faire un refactor multi-fichiers, tenir une longue session agentique — Opus 4.8 reprend la tête. Mais l’honnêteté oblige à le dire : il n’est pas premier partout.

Le vrai saut : la fiabilité, pas la puissance

Voici ce que la course aux benchmarks de capacité te fait rater. Le meilleur argument d’Opus 4.8, ce n’est pas un score plus haut. C’est un score plus bas — sur le mauvais comportement.

Graphique à barres d'Anthropic mesurant le comportement désaligné (score de 1 à 10, plus bas est mieux) pour Sonnet 4.6, Mythos Preview, Opus 4.7 et Opus 4.8.
Comportement désaligné, plus bas est mieux. Opus 4.8 (à droite) chute nettement sous Opus 4.7 et se rapproche du meilleur score du lot. C'est le vrai changement de génération. · Source : Anthropic

Opus 4.7 était l’un des plus mauvais élèves sur cette mesure. Opus 4.8 corrige ça d’un coup et rejoint le peloton de tête. Traduit pour un opérateur : le modèle est moins susceptible de te raconter qu’une tâche est finie quand elle ne l’est pas, d’inventer un résultat, ou de laisser passer un problème qu’il a lui-même créé.

Le chiffre qui compte le plus est là-dessus. Dans les mots d’Anthropic, Opus 4.8 est « environ quatre fois moins susceptible que son prédécesseur de laisser passer, sans le signaler, une faille dans le code qu’il a écrit ». Si tu délègues du code à un agent, c’est exactement la métrique qui décide si tu dors la nuit. Anthropic affirme aussi qu’il « atteint de nouveaux sommets sur nos mesures de traits pro-sociaux, comme le respect de l’autonomie de l’utilisateur ». Sur du marketing, on hausse les épaules. Sur une mesure d’alignement chiffrée et publiée, on note.

Le prix : c’est là que ça bascule

Opus 4.8, c’est 5 $US le million de tokens en entrée et 25 $US en sortie, soit environ 6,75 et 33,75 $ CAD. Fable 5, c’est 10 et 50 $US. Le double.

Pose les deux côte à côte. Fable 5 est devant sur le raisonnement brut le plus dur, oui. Mais sur les tâches agentiques que tu fais tous les jours — lire du code, piloter un ordinateur, tenir une longue session d’agent — Opus 4.8 est à quelques points, et te coûte moitié moins. Sur un pipeline qui brûle des tokens en continu, cet écart de prix décide de la rentabilité de ton produit, pas d’une ligne de benchmark.

Important

Attention au « fast mode ». Le tarif de 5 / 25 $US, c’est l’usage régulier. Le mode rapide d’Opus 4.8 est facturé au double : 10 $US l’entrée et 50 $US la sortie, exactement le prix de Fable 5. Si tu actives la vitesse par défaut sans y penser, tu payes le prix Fable pour du Opus. Vérifie ton mode avant de brancher ça sur un volume.

Pour qui, concrètement

Tu veux le portrait complet de la gamme — Sonnet, Opus, Fable, et où chaque modèle est rentable ? On tient la fiche Claude à jour à chaque release, prix vérifiés à la main. Et si tu hésites avec le haut de gamme, on a décortiqué la revue de Claude Fable 5 — le modèle le plus capable, et ce qu’il refuse de faire.

On continue à la Taverne ?

Un courriel par semaine. Pas de fluff.

En t'abonnant, tu reçois Le Tour de Table chaque semaine. Tu peux te désabonner en un clic. Voir notre politique de confidentialité.

Texte par David Cyr