IA

Claude Opus 4.7 : 64,3% sur SWE-bench, 30% de coûts en moins chez Box, et Mythos toujours hors de portée

Alexandre
Alexandre
··
Durée de lecture : 9 min
Anthropic sort Claude Opus 4.7 le 16 avril 2026. 64,3% sur SWE-bench Pro (contre 57,7% pour GPT-5.4 et 53,4% pour Opus 4.6). Box a réduit ses coûts d'infra IA de 30%. XBOW passe de 54,5% à 98,5% en pen-testing autonome. Et dans le même tableau de benchmarks, Anthropic affiche un modèle encore meilleur... auquel personne n'a accès.
Opus 4.7 débarque quatre jours après la crise d'Opus 4.6, où des milliers de devs avaient documenté des régressions sur GitHub, Hacker News et X. Le timing n'est vraiment pas un hasard.
Décryptage.

En un coup d'œil

Opus 4.7 est devant tout le monde sur l'agentic coding (la capacité d'un modèle à résoudre des bugs réels sur des repos open-source, en autonomie) parmi les modèles disponibles en avril 2026. Mythos Preview domine partout, mais tu ne peux pas l'utiliser.
BenchmarkOpus 4.7Opus 4.6GPT-5.4Gemini 3.1 Pro
Agentic coding, SWE-bench Pro64,3%53,4%57,7%54,2%
Agentic coding, SWE-bench Verified87,6%80,8%80,6%
Scaled tool use, MCP-Atlas77,3%75,8%68,1%73,9%
Raisonnement avancé, GPQA Diamond94,2%91,3%94,4%94,3%
Raisonnement visuel, CharXiv (avec outils)91,0%84,7%
Agentic search, BrowseComp79,3%83,7%89,3%85,9%
Mythos Preview n'est pas dans ce tableau parce qu'il n'est pas dispo en GA. Anthropic a quand même publié ses chiffres. On y revient.

Ce qui a vraiment changé

Opus 4.7 corrige les trois galères principales d'Opus 4.6 : il vérifie ses sorties avant de te les renvoyer, il ne zappe plus l'étape 4 sur 6 dans une chaîne d'instructions, et il tient la cohérence sur des sessions de plusieurs heures. La résolution d'image passe de 685 à 2 576 pixels, et un nouveau niveau d'effort xhigh remplace le maximum précédent.
Auto-vérification. Le modèle relit ce qu'il produit avant de reporter. Les erreurs d'outils ont chuté à un tiers du niveau d'avant, confirmé par Anthropic et les testeurs enterprise (aimlapi.com). Si tu as déjà vu Claude te dire "c'est fait" alors que 80% du boulot restait à faire, tu sais exactement ce que ça corrige.
Suivi d'instructions. Le truc qui rendait dingue sur 4.6, c'était les chaînes multi-étapes où il prenait un raccourci en plein milieu. Genre tu lui donnes 6 étapes, il en fait 3 correctement et bâcle les autres. Sur 4.7, le raisonnement agentique multi-étapes a progressé de 14% selon les testeurs en early access. En pratique, il ne saute plus de marches.
Cohérence long contexte. Sur une session de plusieurs heures, la première instruction survit. C'est exactement ce qu'Opus 4.6 avait cassé à partir de février : la dérive d'instructions, quand le modèle oublie ce que tu lui as dit à l'heure une. Des devs ont quand même signalé des régressions dans des cas spécifiques, donc c'est pas parfait partout.
Résolution d'image x3,75. On passe à 2 576 pixels en natif, contre environ 685 sur 4.6. CharXiv Reasoning monte à 91,0% avec les outils (84,7% avant). Pour ceux qui bossent avec des screenshots d'UI, des diagrammes d'archi ou des documents techniques, ça change vraiment la donne : plus besoin de pré-traiter les images pour que le modèle arrive à les lire (ayautomate.com).
Niveau d'effort xhigh. Un cran au-dessus de high. Plus de latence, plus de profondeur de raisonnement. C'est le défaut dans Claude Code avec Opus 4.7.

La réaction sur X

Deux camps. Ceux qui voient Opus 4.7 comme la réhabilitation après la crise 4.6. Et ceux qui se demandent pourquoi on fête un modèle alors qu'Anthropic montre publiquement qu'il en a un meilleur sous le coude.
L'annonce officielle de @claudeai :
Chargement du tweet...
Et du côté @ClaudeDevs, le compte dédié aux devs :
Chargement du tweet...
Les devs frustrés par 4.6 depuis février ont pris ça comme une victoire. Un senior director chez AMD avait écrit sur GitHub : "Claude a régressé au point de ne plus pouvoir être utilisé pour de l'ingénierie complexe." Le post avait beaucoup circulé. Les chiffres du 16 avril sont une réponse directe à ça.
Un dev a noté un truc pratique : "Opus 4.7 est dans Claude Code, le nouveau niveau d'effort xhigh est le défaut maintenant." Le take sceptique a suivi direct : "Mon hypothèse, c'est que c'est du dynamic thinking qui consomme moins de tokens." Possible. L'autre camp ne célèbre rien. Si Mythos Preview existe déjà et est déjà meilleur, qu'est-ce qu'on fête exactement ?
Le titre de Gizmodo résume bien l'ambiance : "Anthropic Releases Claude Opus 4.7 to Remind Everyone How Great Mythos Is."

Les chiffres des vraies entreprises

Box a réduit ses appels modèle de 56%, ses appels d'outils de 50%, et sa facture IA de 30% en passant à Opus 4.7, à qualité de sortie équivalente. XBOW est passé de 54,5% à 98,5% en pen-testing autonome. C'est du terrain, pas du labo.
Yashodha Bhavnani, Head of AI chez Box, a publié les chiffres : 56% d'appels au modèle en moins, 50% d'appels d'outils en moins, 24% de réponses plus rapides, et 30% de consommation d'AI units en moins par rapport à Opus 4.6, à qualité équivalente. Pour une boîte qui fait tourner ça à l'échelle, c'est hyper concret.
Replit a obtenu la même qualité de code à moindre coût. Signal cohérent.
XBOW, la boîte de pen-testing autonome, passe de 54,5% à 98,5%. Le plus gros saut que j'aie vu sur un seul changement de modèle. Anthropic précise qu'ils ont volontairement limité les capacités cyber d'Opus 4.7 par rapport à Mythos Preview (les nouvelles protections sont testées d'abord sur le modèle le moins puissant). Le chiffre vient avec cette nuance. Ça reste 98,5%.
Une plateforme fintech en early access résume l'auto-vérification en pratique : "Il détecte ses propres fautes logiques pendant la phase de planification et accélère l'exécution, bien au-delà des modèles Claude précédents."
Perso, c'est le chiffre de Box qui me parle le plus. 30% de coûts en moins à qualité égale, c'est le genre de truc qui justifie de migrer un pipeline en prod sans stresser. Sur Waku avec Claude Code, la réduction du nombre d'appels d'outils se traduit directement en sessions plus propres. Moins de retries, moins de boucles inutiles, moins de tokens brûlés dans le vide.

Le coût caché : le tokenizer gonfle la facture de 5 à 35%

Le prix affiché n'a pas bougé : 5$ par million de tokens en entrée, 25$ en sortie. Mais le nouveau tokenizer d'Opus 4.7 gonfle les compteurs de 5 à 35% selon les cas d'usage. En gros, tu paies pareil au token, mais tu consommes plus de tokens pour la même chose.
C'est un truc que tu ne lis nulle part dans le communiqué officiel. Le sticker price est identique à Opus 4.6. Mais le tokenizer a changé, et la même conversation, le même prompt, le même fichier de code produit plus de tokens qu'avant (ayautomate.com). Sur un usage léger, c'est invisible. Sur un pipeline automatisé qui traite des milliers de fichiers par jour, ça se voit sur la facture.
Du coup, avant de migrer : tester les pipelines les plus lourds (vision, documents longs, repos entiers) et comparer le nombre de tokens avant/après. Le prompt caching réduit jusqu'à 90% des coûts d'entrée, et la Batch API offre 50% de réduction. Mais ces optimisations existaient déjà sur 4.6. Le delta réel, c'est le tokenizer.
J'ai documenté ce genre de piège dans mon guide pour diviser la consommation de tokens par 2. Les économies ne se font pas au niveau du modèle, mais au niveau du workflow : ce que tu envoies, comment tu structures tes prompts, et combien de contexte tu charges pour rien.

Mythos : le plafond que tu vois mais que tu ne peux pas atteindre

Anthropic publie Opus 4.7 avec un tableau de benchmarks qui inclut Mythos Preview, un modèle meilleur sur tous les axes, auquel tu n'as pas accès. SWE-bench Pro : Mythos à 77,8%, Opus 4.7 à 64,3%. Terminal coding : 82,0% contre 69,4%. Reproduction de vulnérabilités : 83,1% contre 73,1%.
Mythos Preview a été lancé le 7 avril 2026 sous Project Glasswing, d'abord accessible à 11 entreprises pour la découverte de vulnérabilités cybersécurité. Ensuite élargi à environ 150 partenaires dans plus de quinze pays. Pas de dispo générale. Apple et quelques gros fournisseurs de plateformes font partie des premiers.
En juin, ça s'est compliqué. Le 12 juin, le Département du Commerce américain a imposé la suspension de tout accès aux modèles de classe Mythos pour les ressortissants étrangers, y compris les employés d'Anthropic (Wikipedia). Le 26 juin, l'accès a été rétabli pour plus de 100 organisations américaines, mais Mythos reste inaccessible pour les non-américains. Anthropic prépare un programme "trusted-access" pour la cybersécurité défensive et la recherche biomédicale. Aucun calendrier pour une dispo générale.
Alors oui, Opus 4.7 est le meilleur modèle disponible pour la plupart des devs. Il mène sur l'agentic coding parmi les modèles publics. Mais Anthropic continue de publier les benchmarks d'un modèle que tu ne peux pas utiliser, juste à côté de celui que tu paies. Franchement, c'est un choix de comm qui crée plus de frustration que de hype.

Après quelques semaines dessus

Le vrai test, c'est pas le jour du lancement. C'est trois semaines plus tard, quand tu bosses dessus sans y penser. Sur Waku, la dérive d'instructions qui rendait Opus 4.6 pénible à partir de la deuxième heure n'est pas réapparue une seule fois.
Mon point de données perso. Les 30% de réduction de coûts de Box, c'est le signal enterprise. Le mien : j'ai arrêté de douter du modèle en milieu de session.
Pas parce qu'il produit plus. Parce qu'il est plus prévisible. Quand tu sais que la session va tenir, tu planifies autrement. Tu charges des tâches plus lourdes. Tu fais confiance au premier résultat au lieu de relancer trois fois pour vérifier. Mon setup complet est détaillé dans mon retour sur Claude Code, et l'architecture des agents de code IA explique pourquoi la cohérence sur la durée fait vraiment la différence quand tu bosses seul.
Depuis, Opus 4.8 est sorti avec un adaptive thinking refondu. Le paysage continue de bouger. Opus 4.7, c'est le modèle qui a réparé la confiance après la crise 4.6.

Les 3 trucs à retenir

1. La prévisibilité vaut plus que la puissance

Les 30% d'économies de Box et le +14% en raisonnement multi-étapes, c'est important. Mais le vrai gain, c'est de ne plus douter en milieu de session. Un modèle sur lequel tu peux compter pendant trois heures, ça change ta façon de planifier la journée.

2. Le tokenizer est un coût caché

Même prix affiché, 5-35% de tokens en plus. Sur un usage solo, c'est marginal. Sur un pipeline automatisé, c'est une ligne de facture qui monte sans prévenir. Tester avant de migrer.

3. Mythos, c'est un signal, pas un produit

Publier un modèle meilleur et inaccessible, c'est de la comm. En pratique, Opus 4.7 (puis 4.8) reste ce avec quoi on ship. Le vrai enjeu c'est la fiabilité du modèle que tu utilises chaque jour, pas les benchmarks d'un truc que tu ne peux pas toucher.

Conclusion

Opus 4.7 fait ce qu'Opus 4.6 aurait dû faire depuis le début : lire avant d'écrire, vérifier avant de reporter, tenir les instructions sur la durée. Les chiffres enterprise (Box, XBOW, Replit) confirment le gain. Le tokenizer gonfle la facture en douce. Et Mythos reste un plafond visible mais inaccessible.
L'outil avec lequel je ship demain, c'est celui-là. Et toi, tu as senti la différence entre 4.6 et 4.7 sur tes projets ? Envoie-moi un message sur X ou en commentaire.
Alex

À retenir

  • Opus 4.7 mène sur l'agentic coding avec 64,3% sur SWE-bench Pro, devant GPT-5.4 (57,7%) et Opus 4.6 (53,4%). L'auto-vérification et le suivi d'instructions corrigent les galères principales de la version précédente.
  • Box a réduit ses coûts IA de 30% et ses appels modèle de 56% en passant à Opus 4.7, à qualité équivalente. XBOW passe de 54,5% à 98,5% en pen-testing autonome.
  • Le tokenizer gonfle les compteurs de 5 à 35% malgré un prix affiché identique. Tester ses pipelines avant migration.
  • Mythos Preview domine tous les benchmarks mais reste inaccessible. L'accès a été suspendu en juin 2026 pour les non-américains suite aux contrôles export du Département du Commerce.
  • La prévisibilité vaut plus que la puissance brute. Opus 4.7 répare la confiance qu'Opus 4.6 avait cassée.
Écrit le 16 avril 2026, mis à jour le 23 juillet 2026. Sources : Blog Anthropic, The Next Web, CNBC, 9to5Mac, Gizmodo, Axios, Wikipedia Claude AI, ayautomate.com.

Je suis Alex, créateur de Waku. Retrouve-moi sur Twitter/X et Instagram.

Commentaires

Commentaires

Tu as un avis sur cet article ?

Crée un compte gratuit en 10 secondes pour commenter, laisser des likes et recevoir les prochains articles directement dans ta boîte mail.

Pas encore de compte ?

Ce site utilise des cookies pour les statistiques de visite et la publicité. Aucune donnée personnelle n'est revendue. En savoir plus