Dans l’aviation commerciale, les gros porteurs font les couvertures et les monocouloirs font les comptes. L’appareil le plus long sert de vitrine, mais l’essentiel du trafic voyage dans un avion moyen, dont le constructeur soigne la consommation plutôt que le record de distance. Un catalogue range ses produits par capacité croissante ; il ne dit jamais lequel fait vivre l’usine.

L’industrie des grands modèles de langage a repris cette architecture à trois étages, et vient d’y jouer son coup au milieu. Anthropic a publié le 28 septembre 2026 Claude Sonnet 5.5, deuxième modèle de la famille 5.5, trois mois après Sonnet 5 sorti fin juin. Le 22 septembre, en mettant Opus 5.5 en ligne, la firme annonçait ce palier et Haiku 5.5 pour les semaines suivantes : six jours ont suffi au premier, le troisième reste attendu.

La promesse tient en deux pourcentages, plus de 30 % de vitesse gagnée et jusqu’à 30 % de coût en moins par tâche, et elle ne se vérifie pas sur une page de tarifs puisque la grille n’a pas bougé d’un centime. Ce que le modèle consomme, le réglage auquel on le fait tourner, les garde-fous descendus sur ce palier et la place qu’il occupe dans la gamme forment la matière de cette sortie.

Un palier intermédiaire livré six jours après le haut de gamme

Le laboratoire range le nouveau venu en compagnon d’Opus 5.5 : plus prompt, moins onéreux, le haut de gamme gardant les chantiers difficiles. Il le dit « le plus performant sur les tâches quotidiennes bien délimitées », soit corriger un bogue ou produire un document, une présentation, un tableur ; il lui prête un sens du design visible sur les interfaces et sur le respect des gabarits, et rapporte de ses premiers testeurs une écriture jugée plus nette.

Le compte Claude résumait l’argument le 28 septembre : « Claude Sonnet 5.5 représente une nette amélioration par rapport à Sonnet 5, avec des performances supérieures de plus de 30 % et un coût jusqu’à 30 % inférieur pour la plupart des tâches. » Le modèle remplace aussitôt Sonnet 5 comme défaut de l’offre gratuite, répond à l’identifiant claude-sonnet-5-5 sur l’API, arrive sur Amazon Bedrock, Google Cloud et Microsoft Foundry, et se convoque dans Claude Code par /model sonnet, Opus 5.5 y restant le défaut.

L’économie annoncée ne vient pas de la grille

Un tarif inchangé et un modèle plus sobre

Le prix affiché est celui de Sonnet 5, à 2 dollars le million de jetons en entrée et 10 en sortie, et le tokeniseur est le même, de sorte qu’un texte donné produit exactement le même nombre de jetons. L’économie vient de la quantité consommée : chez Balyasny Asset Management, sur 2 441 tâches de finance, Sonnet 5.5 a produit 121 000 jetons par réponse là où Sonnet 5 en produisait 497 000.

Le mécanisme, observé pendant les tests avec les premiers utilisateurs, tient au regroupement des appels d’outils : le modèle en enchaîne plusieurs avant de rendre la main, ce qui réduit le nombre d’étapes pour boucler une tâche. Les mesures clients vont dans le même sens sans donner le même chiffre, de 14 % de jetons de sortie en moins chez Slack à un tiers d’appels d’outils en moins chez Lovable, ou 3,6 itérations par application chez Base44 contre 7,7 à Opus 5.

La vitesse mesurée ailleurs que dans le communiqué

Le gain annoncé se retrouve dans les relevés indépendants. Réglé au cran moyen, le modèle produit 104,4 jetons par seconde et rend son premier jeton en 1,21 seconde, quand la médiane des modèles de raisonnement de sa tranche de prix s’établit à 3,89 secondes. Au même réglage, il dépense 29 millions de jetons de sortie pour passer l’indice d’Artificial Analysis, contre une médiane de 88 millions.

Un point de fonctionnement déplacé

Le plancher du nouveau modèle dépasse le plafond de l’ancien sur plusieurs tests, ce qui autorise à descendre d’un cran d’effort sans perdre en qualité. Les 30 % ne s’obtiennent donc pas en payant moins par jeton, mais en n’ayant plus besoin du réglage cher. L’économie est conditionnelle : elle suppose qu’une équipe rejoue ses évaluations et abaisse son réglage, et qui ne touche à rien ne la verra pas.

Le même modèle, dix-huit fois plus cher selon un réglage

Le cran de trop

À tarif identique, le coût de passage de l’indice d’intelligence d’Artificial Analysis varie d’un facteur dix-huit selon le seul niveau d’effort : 0,41 dollar par tâche en réglage bas, 0,59 en moyen, 7,60 au maximum, soit environ 49 % de plus que Sonnet 5, mesuré à 5,09 dollars. L’indice obtenu diffère aux deux bouts, 36 points en bas contre 56 au maximum, mais les deux mesures disent vrai parce qu’elles ne décrivent pas le même point de fonctionnement.

Le cran supérieur n’est pas une amélioration marginale, il peut détruire une tâche. Un essai publié le jour de la sortie montre le modèle en effort maximal épuiser les 128 000 jetons de sortie, soit 1,28 dollar, sur un exercice de dessin sans le terminer, quand le cran inférieur le bouclait en 41 secondes pour six centimes. Le même indice le classe deuxième, deux points derrière Opus 5.5.

Un défaut plus élevé en descendant de gamme

Le cran d’effort retenu en l’absence de consigne dépend du guichet : moyen dans les applications Claude et dans Claude Code, élevé sur l’API. La contre-intuition est ailleurs, puisque sur l’API Opus 5.5, le palier au-dessus, démarre en moyen ; une équipe qui descend de gamme pour économiser change de modèle et monte d’un cran de réflexion sans écrire une ligne. Les crans ayant été recalibrés, reporter un réglage de Sonnet 5 ne reconduit pas le même comportement.

Ce que recouvrent les scores

Les résultats revendiqués placent le modèle loin devant Sonnet 5 : 70,6 % sur Terminal-Bench 4.0 contre 10,3 %, 80,1 % sur OSWorld 2.1 contre 57,0 %, 55,5 % sur CursorBench 4.0 contre 34,1 %, 1 844 points Elo sur GDPval-AA contre 1 449. Face à Opus 5.5, l’écart se réduit à presque rien, deux points d’Elo, et change de sens selon l’épreuve : 57,8 % contre 55,5 % sur CursorBench, mais 66,4 % contre 70,6 % sur Terminal-Bench.

Anthropic concède que ces scores « ne reflètent qu’une facette des capacités d’un modèle » et continue de placer Opus 5.5 très au-dessus dès qu’une tâche s’ouvre, dure et réclame un jugement tenu. Elle pose deux réserves sur ses propres chiffres : les résultats GDPval-AA viennent d’une version antérieure où un bogue depuis corrigé a pu affecter les sorties structurées, et sur FrontierCode le réglage maximal fait moins bien que le cran en dessous.

Le test où le modèle revendique son plus gros écart mérite un regard. Terminal-Bench 4.0 place l’agent devant soixante-six travaux menés depuis un terminal, du logiciel au matériel, et ne valide une épreuve que si tous ses tests passent ; rejoué dans un harnais tiers, il donne 63,6 % à Sonnet 5.5 et 59,6 % à Opus 5.5. Une économie de 30 % ne dit pas la même chose sur une requête de conversation et sur une longue session d’agent, où le regroupement des appels d’outils a de la matière.

Des garde-fous de modèle de pointe sur un palier grand public

Aucun Sonnet n’avait encore reçu les protections cyber que la maison gardait pour ses modèles les plus puissants ; celui-ci les emporte, parce que le laboratoire situe son niveau en sécurité informatique à hauteur d’Opus 5. Déboguer du code ordinaire ne déclenche rien, mais une demande de sécurité délicate est réorientée, au vu de l’utilisateur, vers Sonnet 5, et la presse technique européenne note que le filtre attrape parfois des requêtes légitimes.

Cinq catégories de refus et un repli partiel

La contrepartie tient dans un guichet, le Cyber Verification Program, une inscription sur dossier qui ouvre l’usage double à haut risque aux équipes de défense vérifiées. Les refus, eux, arrivent en HTTP 200 avec un motif d’arrêt explicite et se rangent en cinq catégories ; un repli côté serveur rejoue sur Sonnet 5 celles qui touchent au cyber et aux modèles concurrents, mais pas les trois autres.

Le verrou anti-distillation et ce qu’il coûte aux honnêtes gens

Le modèle embarque en outre des classifieurs chargés d’empêcher qu’on lui soutire son raisonnement, pensés contre la distillation, cette aspiration des capacités d’un modèle menée depuis des milliers de faux comptes. Sonnet 5.5 est le premier modèle Claude dont les blocs de réflexion sont liés au compte qui les a produits : renvoyé depuis un autre compte, un bloc est écarté avant que le modèle le voie.

Le liage joue aussi d’un modèle à l’autre, et dans un seul sens. Sonnet 5.5 lit les blocs de Sonnet 5, d’Opus 4.8 et de Haiku 4.5, jamais ceux d’Opus 5, d’Opus 5.5, de Fable ou de Mythos, et aucun autre modèle ne lit les siens : on remonte le temps, jamais la gamme. C’est la fermeture d’une attaque déposée sur arXiv le 10 août 2026, qui exploitait des traces chiffrées mais interchangeables entre modèles.

Une nouvelle catégorie de refus se déclenche lorsqu’une requête demande au modèle de reproduire son raisonnement interne dans sa réponse, pratique courante de mise au point, d’audit et de journalisation. La documentation invite à retirer ces instructions des prompts existants, et le repli automatique vers Sonnet 5 ne rattrape pas ces refus-là.

Ce que la bascule coûte à qui construit dessus

Cinq changements cassent un code qui tournait la veille sur Sonnet 5, et le plus contraignant touche la réflexion : elle ne se désactive plus, il faut passer par le réglage between_tools, accepté aux trois premiers crans d’effort seulement, qui n’admet aucun autre champ et interdit de changer d’effort en cours de conversation. Les quatre autres portent sur l’appel d’outil forcé, le liage des blocs de réflexion, l’outil d’usage de l’ordinateur et les appariements de l’outil conseiller.

Le portage a sa contrepartie outillée, une commande de migration qui applique sur une base de code entière l’identifiant, les paramètres devenus invalides et le recalibrage d’effort. Le levier de coût le plus efficace reste pourtant la consigne système : en effort maximal sur des tâches de code, interdire au modèle de lancer des sous-agents de revue a réduit le coût de session d’environ un tiers.

Une rupture qui ne renvoie aucune erreur

La sixième modification ne casse aucune requête, et c’est la seule qui se voie à l’écran. Entre deux appels d’outils, les notes de plus d’une phrase reviennent dans des blocs de réflexion dont le texte est vide sous le réglage d’affichage par défaut. Une application qui diffusait ces notes à ses utilisateurs devient silencieuse pendant une longue séquence d’outils, sans qu’aucun code d’erreur ne le signale.

La place exacte du palier intermédiaire

La grille range la gamme sans ambiguïté : Fable 5.1 à 10 et 50 dollars le million de jetons, Opus 5.5 à 4 et 20, Sonnet 5.5 à 2 et 10, Haiku 4.5 à 1 et 5. Le palier intermédiaire coûte deux fois moins que le haut de gamme et cinq fois moins que le modèle le plus cher, pour la même fenêtre d’un million de jetons et une coupure de connaissance en juin 2026.

L’information la plus parlante se lit sous le palier, pas au-dessus. Le seul modèle d’entrée de gamme disponible reste Haiku 4.5, avec 200 000 jetons de contexte au lieu d’un million et une coupure de connaissance en février 2025, seize mois plus tôt. Il n’y a jamais eu de Haiku 5, et Haiku 5.5 n’est qu’annoncé : le milieu de gamme occupe donc aussi tout le bas de la gamme par défaut, ce que confirme sa promotion au rang de modèle gratuit.

Ce rattrapage du haut de gamme par le milieu est le schéma fondateur de la maison : les trois paliers ont été introduits en mars 2024 par capacité croissante, et trois mois et demi plus tard Claude 3.5 Sonnet dépassait Claude 3 Opus sur une large part des évaluations maison, avec 64 % des problèmes d’un test interne de code agentique contre 38 %.

Une sortie de modèle intermédiaire se juge mal à ses scores, qui la placent à deux points de son propre haut de gamme, et mieux à la facture qu’elle produira chez ceux qui construisent dessus. Cette facture ne dépend ni du tarif, identique, ni du tokeniseur, inchangé, mais d’un curseur à cinq positions dont la valeur par défaut varie selon l’environnement d’appel.

Le même logiciel peut coûter 0,41 dollar ou 7,60 dollars la tâche sans qu’une ligne de grille bouge, et un cran mal choisi transforme un exercice bouclé en quarante secondes en une sortie tronquée et facturée. La promesse de vitesse rencontre même sa contradiction à l’écran, où des notes de progression devenues invisibles font passer pour muet un modèle qui travaille.

Restent les garde-fous, qui font plus qu’une révision de gamme. Descendre sur un palier grand public des protections réservées aux modèles de pointe, lier les traces de raisonnement au compte qui les a produites, refuser qu’un modèle explicite son raisonnement à la demande : ces gestes admettent que la valeur à défendre n’est plus seulement dans les poids. Ce qu’un client a le droit de lire de ce qu’il paye décide de ce qu’un audit pourra établir sur des systèmes que de plus en plus de métiers laissent agir seuls.

Aller plus loin

Les revendications gagnent à être lues dans leur formulation d’origine, et l’annonce Introducing Claude Sonnet 5.5 aligne le tableau complet des scores face à Sonnet 5 et Opus 5.5, la grille tarifaire inchangée et les témoignages clients chiffrés, dont les 121 000 jetons par réponse de Balyasny contre 497 000, seul chiffre qui rende l’économie vérifiable.

La place du palier se lit sur une ligne par modèle, et la fiche Claude Sonnet 5.5, page modèle met côte à côte Fable 5.1, Opus 5.5, Sonnet 5.5 et Haiku 4.5 avec contexte, sortie maximale, prix, latence, mode de réflexion, effort par défaut, coupure de connaissance et engagement de non-retrait daté à un an.

Ce que le communiqué passe sous silence occupe les notes de version, où What’s new in Claude Sonnet 5.5 donne les cinq ruptures avec leurs messages d’erreur exacts, les règles précises de between_tools, les cinq catégories de refus et cette sixième modification qui rend une interface muette entre deux appels d’outils.

Pour qui construit, le document le plus immédiatement rentable est Prompting Claude Sonnet 5.5, qui détaille le calibrage de l’effort, la consigne système coupant d’un tiers le coût de session en réglage maximal, et le cas où un outil de recadrage bat un cran de puissance supplémentaire.

La facture se règle en réalité sur un seul paramètre, et la page Effort, la documentation du réglage en donne les cinq niveaux, les défauts modèle par modèle, l’effet d’un cran plus bas sur le nombre et la concision des appels d’outils, et le changement d’effort en cours de conversation qui préserve le prompt mis en cache.

Le dossier de sûreté est servi à part, et la System Card: Claude Sonnet 5.5 expose en un PDF de plus de dix mégaoctets les évaluations cyber qui justifient la descente des garde-fous sur un palier intermédiaire, les protections visant le développement de modèles de pointe et le dispositif de repli sur Sonnet 5.

La contre-mesure indépendante complique le récit, puisque Claude Sonnet 5.5 reaches #2 on the Artificial Analysis Intelligence Index place le modèle à 56 points, deux derrière Opus 5.5, mais relève environ 193 000 jetons de sortie par tâche et un coût de 7,60 dollars au réglage maximal.

Le test le plus cité mérite d’être rejoué ailleurs, et le Terminal-Bench 4.0 Benchmark Leaderboard le refait dans un harnais tiers, 66 tâches passées trois fois, pour 63,6 % à Sonnet 5.5 contre 59,6 % à Opus 5.5, et donne pour exemples d’épreuves une migration de base de données, un routage photonique et une pièce de conception mécanique.

L’origine scientifique du verrou tient dans Stealing Reasoning Traces from Proprietary LLM APIs, qui montre comment injecter le raisonnement chiffré d’un modèle puissant dans un modèle plus faible du même fournisseur, et ce que contenaient les 315 320 blocs moissonnés par les auteurs dans des dépôts publics, dont 182 identifiants.

L’épreuve du terrain vaut le communiqué, et les notes de Simon Willison sur Claude Sonnet 5.5 montrent l’effort maximal épuiser 128 000 jetons de sortie sans terminer une tâche que le cran inférieur boucle en 41 secondes pour six centimes, et posent l’enjeu du modèle devenu porte d’entrée gratuite.

Lus ensemble, ces documents décrivent une sortie dont l’essentiel ne tient pas dans le prix affiché. La grille est celle du modèle remplacé, le tokeniseur aussi, et tout l’écart se joue dans le nombre d’étapes qu’un modèle s’épargne, dans un curseur d’effort dont le défaut change selon l’environnement, et dans ce que le fournisseur rend lisible de son raisonnement. Le palier intermédiaire n’est plus le compromis d’une gamme : il en est devenu la porte d’entrée et la surface la plus exposée.