Dans un parc d’imprimantes de bureau, le prix de la cartouche renseigne mal sur la dépense : ce qui compte est le coût de la page, soit le prix divisé par le rendement, majoré ou réduit selon le mode d’impression. Un appareil d’entrée de gamme très sollicité se juge sur cette arithmétique plus que sur l’étiquette.

Les modèles d’intelligence artificielle facturés au jeton obéissent à la même règle, surtout au bas des gammes. Le 7 octobre 2026, Anthropic a mis en ligne Claude Haiku 5.5, le plus petit modèle de la famille 5.5, dont le million de jetons d’entrée est affiché à 0,10 dollar. Le facteur dix mis en avant vaut face à Haiku 4.5, non face à GPT-6 Luna, dont la grille est identique au centime ; recalculé pour une tâche entière, il retombe vers quatre.

Il faut d’abord démêler ce que recouvrent le dix, la parité et le quatre, puis suivre pas à pas la mécanique qui mène de l’un à l’autre, avant d’évaluer des modèles de cette taille, leurs usages et les conditions qui entourent le prix, sur un marché dont ni Haiku 5.5 ni Luna ne forment le plancher des prix.

Le palier qui referme la famille 5.5

Opus 5.5, sorti le 22 septembre, annonçait Haiku 5.5 pour les semaines suivantes ; Sonnet 5.5 est arrivé le 28, et le plus petit modèle referme la famille le 7 octobre. Il s’appelle claude-haiku-5-5 dans l’API, l’interface par laquelle un programme interroge un modèle, et Google Cloud, Microsoft Azure et Amazon Web Services le proposent aussi.

Anthropic vise les tâches brèves et répétées en masse : synthèses, tri des requêtes, interrogation de bases de données, et les assistants dont la réactivité compte, tel un service d’assistance en ligne. S’y ajoutent la compaction, qui résume le début d’un long échange pour qu’un agent garde de la place en mémoire, et le rôle de sous-agent, que sollicitent Opus 5.5 ou Sonnet 5.5 pour les petits travaux de programmation.

À vitesse standard, Haiku est le modèle le plus rapide d’Anthropic, avec une réserve en note de bas de page : le mode fast d’Opus, dont le débit de sortie peut atteindre 2,5 fois celui du mode normal et qui coûte deux fois le prix de base d’Opus 5.5, reste devant. C’est aussi le premier Haiku doté d’un réglage d’effort, qui permet d’acheter plus de réflexion ou plus d’économie.

Dix fois moins cher, mais face à qui

Face à Haiku 4.5, un facteur dix au jeton

La grille de Haiku 5.5 affiche 0,10 dollar par million de jetons envoyés au modèle, environ 0,09 euro hors taxes, et 0,50 dollar par million de jetons produits, environ 0,45 euro ; le jeton, fragment de mot, sert d’unité de facturation. Haiku 4.5, apparu en octobre 2025, coûtait 1 et 5 dollars, comme l’affichait la grille du 1er juillet, celle de Sonnet 5 : résumer des documents avec Haiku 5.5 coûte dix fois moins par jeton qu’avec son aîné, à condition de rester sous 100 000 jetons. Ce facteur s’applique à chaque poste, entrée, sortie, cache, lots, et renverse la pente de la génération précédente : Haiku 4.5 s’était lancé 25 % au-dessus de Haiku 3.5, facturé 0,80 et 4 dollars, soit environ 0,72 et 3,58 euros, alors que Haiku 5.5 passe sous ses deux aînés.

Face à GPT-6 Luna, une parité au centime

Face à OpenAI, le facteur dix ne tient plus. GPT-6 Luna, son plus petit modèle, lancé le 22 septembre avec GPT-6 Sol peu après Opus 5.5, est facturé 0,10 et 0,50 dollar, exactement comme Haiku 5.5, avec la même lecture de cache à 0,01 dollar, la même écriture à 0,125 et les mêmes lots à moitié prix. Anthropic s’aligne donc sur un tarif qu’OpenAI affiche depuis le 22 septembre, après l’avoir réduit de moitié en entrée et de 58 % en sortie : GPT-5.6 Luna coûtait 0,20 et 1,20 dollar, environ 0,18 et 1,07 euro. OpenAI jouait déjà la carte du prix face à Opus 5.5, en haut de gamme ; ici, rien ne départage les deux modèles sur la grille de base.

De dix à quatre, la mécanique d’une facture

Un seuil qui sépare Haiku 5.5 de Luna

Le facteur dix ne vaut que sous 100 000 jetons de prompt par requête, soit le dixième de la fenêtre d’un million de jetons de Haiku 5.5. Au-delà, il facture l’entrée 0,50 dollar et la sortie 2,50, soit environ 0,45 et 2,24 euros, cinq fois son prix initial, si bien que la remise face à Haiku 4.5 tombe à 50 %. Anthropic précise que 90 % des requêtes de Haiku 4.5 tenaient sous cette barre, proportion comptée en requêtes et non en dollars.

OpenAI place son seuil à 272 000 jetons et n’y relève, pour toute la requête, l’entrée que du double et la sortie de moitié : entre 100 000 et 272 000 jetons, Haiku 5.5 coûte cinq fois plus que Luna, puis, au-delà, 2,5 fois plus en entrée et 3,3 fois plus en sortie. Sur de gros documents à résumer, c’est donc Luna la moins chère.

Ce que le tokeniseur et la réflexion changent au calcul

Haiku 5.5 reprend le tokeniseur des modèles Claude 4.7 et suivants, qui produit environ 30 % de jetons en plus qu’avec Haiku 4.5 pour un même texte, et sa réflexion adaptative, active par défaut, se facture en sortie là où Haiku 4.5 ne réfléchissait pas. À un dixième du prix, ces 30 % donnent 0,13 fois la facture de Haiku 4.5, soit 87 % de baisse sous le seuil, mais 0,65 au-delà, soit 35 % seulement.

Anthropic annonce pourtant un coût moyen inférieur d’environ 75 %, soit un rapport de un à quatre, sans détailler son calcul. L’arithmétique en suggère la composition : atteindre 75 % suppose que la réflexion fasse facturer près de deux fois plus de jetons que le seul tokeniseur, ou qu’environ 77 % de la dépense sur Haiku 4.5 ait eu lieu sous le seuil, et les deux se cumulent sans doute.

Soit une tâche de 2 000 jetons en entrée et 500 en sortie : 0,0045 dollar sur Haiku 4.5, 0,000585 sur Haiku 5.5 avec 30 % de jetons en plus et sans réflexion, soit 7,7 fois moins, mais environ 1 100 jetons de réflexion suffisent à ramener le rapport à un contre quatre. Dans les mêmes conditions, un million de classifications de 1 000 jetons en entrée et 50 en sortie passe de 1 250 dollars à environ 160, ou 310 avec 300 jetons de réflexion.

Le cache et l’effort, boutons des tâches répétées

Pour une consigne répétée des milliers de fois, le cache compte autant que la grille. Son seuil minimal tombe de 4 096 jetons sur Haiku 4.5 à 512 sur Haiku 5.5, et la lecture coûte 0,01 dollar le million : une consigne système de 512 à 4 095 jetons, impossible à mettre en cache sur Haiku 4.5, le devient. Sonnet 5.5 voit aussi sa lecture en cache divisée par deux, de 0,20 à 0,10 dollar le million, environ 0,09 euro ; ces lectures pesant lourd, la majorité des tâches d’agent coûtent environ 20 % de moins sur Sonnet 5.5.

L’effort est l’autre bouton. Haiku 5.5 en offre cinq niveaux, de low à max, et Anthropic en chiffre le prix : sur un long prompt d’agent, passer de low à medium divise à peu près par deux les arrêts prématurés mais fait plus que doubler les jetons de sortie par tentative. Aux niveaux bas, il déclare parfois une modification de code terminée sans l’avoir vérifiée. Reste à comparer le coût attendu d’une réponse correcte, ou cost-of-pass : le prix d’une tentative rapporté à la part de celles qui réussissent.

Ce que valent les plus petits modèles

Dans le tableau d’Anthropic, Luna reste derrière Haiku 5.5 dès qu’elle y figure. Sur OSWorld 2.1, banc où une IA doit conduire un véritable ordinateur pour accomplir des missions à étapes multiples, Haiku 5.5 marque 72,4 %, Luna 48,9 % et Haiku 4.5 15,7 %, sur un sous-ensemble hors ligne, selon un décompte partiel qui récompense aussi les tâches à demi accomplies. Sur Terminal-Bench 4.0, épreuve de programmation au terminal, Haiku 5.5 atteint 39,2 % et Luna 16,4 %, quand Haiku 4.5 plafonnait à 0 % et Sonnet 5.5 monte à 70,6 %.

Ces chiffres émanent d’un constructeur qui a fixé ses réglages, sans préciser l’effort de Luna ni le nombre d’essais, et nul test indépendant n’est publié. L’éditeur concède que Sonnet 5.5 et Opus 5.5 gardent la préférence pour la programmation complexe confiée à un agent : Haiku 5.5 se défend selon ses propres tableaux, mais seuls des essais tiers permettront de trancher.

Les retours de clients, choisis par Anthropic, concordent avec ces tableaux. Asana, éditeur d’outils de gestion de projets, mesure en test interne plus de 30 % de temps en moins pour que ses agents terminent leurs tâches, face au modèle qu’il emploie aujourd’hui. AlphaSense, plateforme de recherche financière dont le service de questions sur documents fait environ 8 millions d’appels par semaine en production, voit son score passer de 0,76 sous Haiku 4.5 à 0,84 sous Haiku 5.5 lors d’un essai de 400 requêtes ; Box, qui héberge les fichiers des entreprises, annonce 11 points d’avance sur Haiku 4.5, échelle non précisée, et des réponses environ deux fois plus rapides. C’est sur de tels volumes que le rabais de prix compte le plus.

Les kits Python et TypeScript d’Anthropic reçoivent une mise à jour en bêta qui permet de confier à Haiku 5.5 la conduite d’un navigateur ou d’un ordinateur, usages que l’éditeur juge adaptés au modèle grâce à sa rapidité et à son faible coût. Le modèle ne s’installe pas sur un téléphone : il tourne chez Anthropic, une application mobile l’appelle par l’API, et sa rapidité se lit dans l’attente à l’écran.

Le bas de gamme n’est pas le plancher du marché

L’échelle des prix s’aiguise par le bas : par million de jetons, Opus 5.5 est à 4 et 20 dollars, Sonnet 5.5 à 2 et 10, Haiku 5.5 à 0,10 et 0,50, soit un rapport de un à deux entre les deux premiers et de un à vingt entre les deux derniers. Anthropic invite à comparer les niveaux xhigh et max de Haiku 5.5 avec Sonnet 5.5, ce qui interroge la raison d’être du milieu de gamme.

Haiku 5.5 et Luna ne forment pourtant pas le plancher du marché : Gemini 2.5 Flash-Lite reste moins cher en sortie, à 0,40 dollar, et DeepSeek V4.1 Flash, à environ 0,15 et 0,60 dollar hors heures de pointe, publie ses poids sous licence MIT, donc hébergeables, tandis que le plus récent Gemini 3.5 Flash-Lite coûte trois fois plus qu’eux en entrée et cinq fois plus en sortie, réflexion comprise. La bataille se joue aussi sur l’exécution : le 6 octobre, OpenAI a mis en bêta une API Decisions alimentée par gpt-6-luna, qui renvoie des réponses typées choisies dans une liste fermée et passe pour dix fois plus rapide que l’API Responses.

Ce que la grille laisse de côté

L’Europe et la résidence des données

Le prix de 0,10 dollar n’est pas celui d’une entreprise européenne qui exige la résidence de ses données. Sur l’API directe d’Anthropic, la géographie d’inférence se limite à us et global, l’option américaine coûtant 1,1 fois le tarif. Amazon Bedrock offre des régions européennes, dont Paris et Francfort, avec 10 % de supplément, mais sans les sorties structurées, l’API de lots ni les nouveaux jeux d’outils d’ordinateur et de navigateur. OpenAI affiche pour Luna une résidence dans l’Union européenne en standard, en Flex et en lots.

Le calendrier de Haiku 4.5

Haiku 4.5 rejoint les modèles anciens de la grille tarifaire, avec un maintien promis jusqu’au 15 octobre 2026 seulement et sans échéance de retrait arrêtée : mieux vaut préparer la bascule, que facilite un guide de migration d’Anthropic. Ce plancher n’est pas une échéance : le préavis promis est d’au moins soixante jours, Haiku 3.5 et Haiku 3 ont été retirés deux mois après leur notification, Sonnet 4.5, notifié le 30 septembre, le sera le 30 novembre. Aucune notification n’ayant été émise pour Haiku 4.5, son retrait ne pourrait guère intervenir avant décembre.

Un crédit d’API pour les abonnés

Anthropic déploie cette semaine pour les formules Max et Team un crédit mensuel d’API, utilisable avec tous ses modèles. Max 5x reçoit 100 dollars par mois, soit environ 89 euros, et Max 20x 200 dollars, soit environ 179 euros, c’est-à-dire le prix de chaque abonnement ; un compte Team peut monter à 500 dollars, soit environ 447 euros, à répartir entre ses membres. Le cabinet SemiAnalysis juge les formules Claude environ cinq fois plus généreuses que celles d’OpenAI sur le milieu de gamme.

Trois chiffres résument Haiku 5.5 sans désigner le même objet : dix pour le prix au jeton face à Haiku 4.5 sous 100 000 jetons, un pour la parité avec Luna sur la grille de base, quatre pour la facture d’une tâche une fois comptés le tokeniseur, la réflexion et le seuil. Le mot moins cher change de sens avec le poste, le prompt et l’effort.

Le terrain de la bataille n’est plus le prix du jeton, aligné au centime par deux concurrents, mais le coût d’une tâche répétée des milliers de fois, que chacun mesure sur ses propres requêtes. Le 22 septembre, Opus 5.5 annonçait une baisse du coût d’exécution supérieure à celle de son prix au jeton ; Haiku 5.5 fait l’inverse, la baisse au jeton dépassant la baisse moyenne annoncée.

Aucune mesure indépendante ne recoupe encore les tableaux d’Anthropic, et une entreprise européenne exigeant la résidence de ses données ne paie pas le tarif affiché : à mesure que le jeton se banalise, la rareté se déplace peut-être vers la vérification du résultat, que le modèle omet parfois, et vers le lieu du calcul.

Aller plus loin

Le point de départ reste la page d’annonce, et Introducing Claude Haiku 5.5 rassemble la grille tarifaire, le tableau face à GPT-6 Luna, des graphiques de coût par tâche à l’échelle logarithmique pour chaque niveau d’effort, les retours de clients, d’Asana à HubSpot, et, en note de bas de page, les remises de 90 % et de 50 % selon la longueur du prompt qui sous-tendent la baisse moyenne d’environ 75 %.

La grille se lit en entier dans Pricing, tarification de l’API Claude, la page tarifaire de la documentation d’Anthropic, qui détaille les prix de chaque modèle, les deux paliers de Haiku 5.5, les multiplicateurs de cache, les tarifs des lots, le surcoût en jetons des jeux d’outils d’ordinateur et de navigateur et la mention que le tokeniseur des modèles récents produit environ 30 % de jetons en plus.

Le coût caché de l’effort est chiffré dans Prompting Claude Haiku 5.5, où Anthropic rapporte que passer de low à medium divise à peu près par deux les arrêts prématurés d’un agent mais plus que double ses jetons de sortie, décrit les changements de code déclarés terminés sans vérification et prévient qu’à xhigh toute la réponse peut rester dans la réflexion.

Pour mettre la parité en regard, Pricing, tarification de l’API d’OpenAI donne les prix standard, Flex et en lots de GPT-6 Luna, la lecture et l’écriture de cache, le seuil de 272 000 jetons, les tarifs majorés au-delà et le supplément régional de 10 %, de quoi refaire la comparaison ligne à ligne.

La chronologie des prix de la gamme Luna se reconstitue dans le Changelog de l’API d’OpenAI, de la sortie de GPT-5.6 le 9 juillet et de la baisse de 80 % du 30 juillet jusqu’à GPT-6 Luna, à 0,10 et 0,50 dollar le 22 septembre, puis à l’API Decisions en bêta le 6 octobre.

Le calendrier de Haiku 4.5 s’apprécie sur Model deprecations, qui pose la règle des soixante jours de préavis, liste les notifications et les retraits de Haiku 3, de Haiku 3.5 et de Sonnet 4.5, classe chaque modèle par statut et montre qu’un maintien jusqu’au 15 octobre 2026 est un plancher, non une date de sortie.

La résidence des données se vérifie dans Data residency, la page d’Anthropic qui n’admet que us et global pour la géographie d’inférence, applique le multiplicateur de 1,1 à l’option américaine, limite le stockage de l’espace de travail aux États-Unis et laisse Amazon Bedrock et Google Cloud fixer leurs propres régions.

Raisonner en coût par réponse correcte plutôt qu’en prix au jeton est l’objet de Cost-of-Pass: An Economic Framework for Evaluating Language Models, où Erol, El, Suzgun, Yuksekgonul et Zou montrent quel type de modèle devient rentable pour quel type de tâche, et que le vote majoritaire et l’auto-correction justifient rarement leur coût.

L’idée de ne solliciter le grand modèle qu’en cas de besoin se lit dans FrugalGPT: How to Use Large Language Models While Reducing Cost and Improving Performance, où Chen, Zaharia et Zou relèvent des écarts de prix de deux ordres de grandeur entre API et montrent qu’une cascade apprise égale GPT-4 avec jusqu’à 98 % de coût en moins.

La thèse des petits modèles pour les agents est défendue dans Small Language Models are the Future of Agentic AI, par des chercheurs de NVIDIA pour qui les systèmes agentiques exécutent surtout des tâches répétitives et spécialisées, position d’un fabricant de puces dont la troisième version date du 22 septembre 2026.

Lus ensemble, ces documents montrent un prix qui se lit ligne à ligne, jamais d’un trait. La grille donne le dix, la documentation le seuil et le tokeniseur, le guide d’effort la réflexion qui reprend ce que le tarif a rendu, les pages d’OpenAI la parité et le déplacement de la bataille vers l’interface, la recherche l’unité qui convient, la tâche menée à son terme plutôt que le jeton.