Le droit du médicament connaît une catégorie qui déroute : la réserve hospitalière. La molécule est autorisée, son efficacité établie, son prix fixé, et pourtant aucune officine ne la délivre. Sa circulation reste confiée à des établissements réputés capables d’en surveiller les effets. L’autorisation d’exister et celle de circuler y sont deux décisions distinctes.
L’industrie des modèles de langage tenait jusqu’ici l’exact contraire. Un modèle annoncé était un modèle disponible, parfois dans l’heure, et la rapidité de livraison était devenue l’argument commercial lui-même : deux modèles de pointe concurrents sont sortis le même jour, le 22 septembre, et le suivant est arrivé sept jours après son prédécesseur.
Le 30 septembre, au lendemain du sommet de la Maison-Blanche sur l’intelligence artificielle et du DevDay d’OpenAI, Google a annoncé Gemini 4 Argon, son prochain modèle de frontière, présenté comme supérieur à GPT-6 Astra, Claude Fable 5.1 et Claude Opus 5.5. En tête de longs mois avec Gemini 3 Pro, l’éditeur s’était fait doubler par OpenAI et Anthropic tout au long de 2026. Son retour n’a pas de date : Argon n’est servi qu’à un petit groupe de cyberdéfenseurs de confiance, par un programme baptisé Fairwind. Restent à examiner ce que recouvre ce mot, ce qu’un éditeur gagne à servir des défenseurs avant des clients, ce que valent ses comparaisons et ce que ses retards disent de lui.
Une annonce sans date, versée dans un canal préexistant
L’entreprise en dit peu. Elle revendique un record sur DeepSWE v1.1, qui éprouve la tenue d’un modèle sur des chantiers logiciels de longue haleine : 77,9 % de réussite, contre 74,2 % pour Claude Opus 5.5, 74,1 % pour GPT-6 Astra et 67,4 % pour Claude Fable 5.1, le trio de tête des classements publics. L’écart est mince, et présenté comme une reconquête. Les clients payants de l’API et les abonnés Google AI Ultra seront servis les premiers ; le calendrier s’arrête là.
Le canal a vingt-huit jours d’avance sur le modèle
Le programme qui héberge Argon n’a pas été ouvert pour lui : Google a lancé Fairwind le 2 septembre 2026 autour d’un modèle spécialisé, Gemini 3.8 Flash Cyber, associé au harnais CodeMender. Vingt-huit jours plus tard, Argon y est versé, dans une plomberie déjà peuplée de plus de six cent cinquante partenaires. La question n’est donc pas pourquoi l’éditeur réserve son modèle, mais pourquoi il disposait déjà d’un endroit où le mettre.
Le mot cyberdéfenseur désigne une institution, pas une compétence
Trois catégories sont éligibles : gouvernements et autorités nationales de cybersécurité, opérateurs d’infrastructures critiques dans la santé, les télécommunications, l’énergie ou la finance, et plateformes technologiques de socle. La qualification ne se déclare pas, elle s’instruit : enquête d’antécédents sur l’historique de sécurité et le bilan éthique du candidat, puis obligations internes contractuelles, de l’accès cantonné aux équipes de sécurité à l’authentification multifacteur.
Ce qu’un éditeur va chercher chez des défenseurs plutôt que chez des clients
Le modèle livré aux défenseurs n’est pas celui du commerce
La diffusion restreinte n’est pas une avant-première, c’est une autre version. Pour ses partenaires de confiance comme pour ses propres équipes, Google annonce diffuser Argon sans garde-fous cyber, pour leur ouvrir l’intégralité de ses capacités défensives ; le public recevra au contraire des protections renforcées contre les usages malveillants. Comme Anthropic avant lui, l’éditeur juge son modèle trop puissant en cybersécurité pour le lâcher sans précaution.
Une case ouverte par le droit américain depuis juin
Le processus volontaire du gouvernement américain que Google dit rejoindre porte un nom : le décret présidentiel 14409, signé le 2 juin 2026. Il invite les éditeurs à ouvrir à l’État jusqu’à trente jours d’accès à un modèle avant de le remettre à d’autres partenaires de confiance, puis à choisir ces partenaires avec lui pour renforcer la cybersécurité des infrastructures critiques. La posture d’Argon y tient en toutes lettres. Le texte écarte toute licence et toute autorisation préalable, mais ces entreprises sont fournisseurs fédéraux, et la commande publique transforme l’adhésion en condition d’accès aux marchés.
Un cadre maison invoqué mais jamais chiffré
Google dispose pourtant d’une grille propre à la justifier. Son Frontier Safety Framework, dont la troisième version a été étendue le 17 avril 2026 par des paliers intermédiaires, range la cybersécurité parmi ses domaines suivis et y fixe un premier seuil critique : un modèle réduisant d’un ordre de grandeur au moins le coût d’une cyberattaque à fort impact. Aucune fiche modèle n’accompagne l’annonce, et le palier atteint par Argon n’est pas indiqué. Le même 30 septembre, GPT-6.1 Sol passait au rouge en cybersécurité, assorti d’un régime d’habilitation à quatre niveaux.
L’ordre de la séquence est le seul fait vraiment neuf
Réserver un modèle à des défenseurs vérifiés n’a rien d’inédit, et les politiques de sûreté du secteur l’inscrivent par écrit. Anthropic a livré en septembre un couple Fable 5.1 et Mythos 5.1, même modèle en version publique et en variante à garde-fous assouplis réservée à des organisations américaines vérifiées ; OpenAI avait bâti Daybreak plus tôt, en paliers, avec un milliard de dollars de crédits depuis le 4 septembre. Google inverse le rang : ailleurs la variante restreinte suit le modèle grand public, ici le modèle phare part d’abord chez les défenseurs.
Douze épreuves sur dix-huit, et ce que le tableau agrège
La victoire revendiquée sur douze épreuves sur dix-huit repose sur un tableau où cohabitent des bancs tenus par des tiers et des évaluations conduites par Google. Certains écarts sont larges : 51,3 % sur AutomationBench contre 41,4 % pour GPT-6 Astra, 40 % pour Claude Opus 5.5 et 31,4 % pour Claude Fable 5.1. Les 91,7 % revendiqués sur LVBench, contre 87,5 %, portent eux sur un jeu académique de compréhension de vidéos longues soumis en 2024.
Les six épreuves perdues figurent dans le même tableau, et les quatre écarts documentés ne sont pas minces. Argon obtient 57,4 % sur Terminal-Bench 4.0 quand Claude Opus 5.5 atteint 66,4 %, 57,6 % sur Terminal-Bench Science 0.1 contre 68,1 % pour GPT-6 Astra, 55,0 % sur FrontierSWE v2 contre 65,5 %, 45,3 % sur PostTrainBench contre 49,3 %. Les trois premiers atteignent ou dépassent neuf points, quand la victoire vedette sur DeepSWE se joue à moins de quatre.
Le banc mis en vitrine est classé défectueux
DeepSWE est produit par Datacurve, une entreprise de données d’entraînement, non par un évaluateur indépendant. Epoch AI l’a audité le 7 septembre et classé défectueux : sur cent treize tâches, au moins vingt-trois produisent des faux négatifs, dont dix-huit par un seul mécanisme. La notation se casse dès que l’agent retouche les fichiers de test existants, alors que rien ne le lui interdit ni ne l’en avertit, et l’auditeur juge ce défaut capable de frapper n’importe quelle tâche.
L’épreuve indépendante la plus exigeante manque au graphique
Sur FrontierSWE v2, tenu par Proximal Labs, trente-quatre tâches aux budgets pouvant atteindre vingt heures, Argon est troisième à 55,0 % en moyenne sur cinq passages, derrière GPT-6 Astra à 65,5 % et Claude Opus 5.5 à 62,3 %, ses essais s’étalant de 44,5 % à 64,3 %. Trois points d’avance ailleurs pèsent peu quand le même modèle varie de vingt points d’un essai à l’autre. Public le jour de l’annonce, ce résultat ne figure pas dans le graphique de Google.
Ce que montrent les évaluateurs tiers
Google revendique aussi la première place sur le Vals Index et sur CWE-bench v1. Le premier vient du seul évaluateur du lot qui conduise ses propres tests : au 29 septembre, il donnait Argon à 68,90 % pour 15,68 dollars par test, devant Claude Opus 5.5 à 67,04 % et GPT-6 Astra à 63,13 %. Le second, publié le 2 septembre, injecte dans des projets figés des vulnérabilités pour déjouer la mémorisation : le meilleur score y était alors d’environ 44 %, et vingt-huit jours plus tard les trois éditeurs sont annoncés entre 67 % et 68 %.
Un million de jetons en sortie et un tarif daté d’avance
Le chiffre mis en avant n’est pas une fenêtre de contexte mais un plafond de génération : Argon produit jusqu’à un million de jetons en une seule fois, contre soixante-quatre mille auparavant chez l’éditeur, quand Claude Opus 5.5 s’arrête à cent vingt-huit mille, trois cent mille par l’API. Le modèle gagne le droit de délibérer longuement et de rendre d’un bloc un chantier qu’il fallait fractionner en tours successifs. La taille de la fenêtre de contexte, elle, reste inconnue.
Reste le prix, annoncé à 2 dollars le million de jetons en entrée et 10 en sortie, soit cinq fois moins que Claude Fable 5.1 à 10 et 50, deux fois moins que Claude Opus 5.5 à 4 et 20. L’avantage a une date de péremption : l’éditeur précise qu’il passera à 4 et 20 dollars après l’introduction, soit exactement la grille du concurrent qu’il prétend distancer. Le coût par jeton reste de toute façon une unité peu parlante, et il porte ici sur un modèle qu’on ne peut pas acheter.
Les mois de retard et ce qu’un report prolongé dit d’un éditeur
L’épisode précédent aurait pu vacciner l’entreprise. Gemini 3.5 Pro est présenté le 19 mai 2026 à Google I/O pour le mois suivant ; la cible glisse à juin, puis à juillet. Le 16 juillet, Bloomberg rapporte des mois de retard sur les objectifs internes, les performances en code restant sous la barre fixée : Alphabet perd 4,4 % dans la séance, environ deux cents milliards de capitalisation. Une mise à jour des données de fin juin avait dégradé les résultats, et des défaillances sur l’appel d’outils récursif ont imposé de relancer le pré-entraînement.
Le modèle n’est jamais sorti : la rumeur parlait de scores décevants et d’un climat dégradé dans les équipes, et la gamme est restée sur des déclinaisons Flash jusqu’à Gemini 3.8 Flash. Google affirme pourtant que des milliers de ses salariés utilisent déjà Argon : sous-routines quantiques optimisées en quelques minutes, entre cinq cents tébioctets et un pébioctet de mémoire libérés sur ses centres de données, problèmes hors de portée humaine résolus. La démonstration interne tient lieu de disponibilité, et aucun Gemini 4 Pro n’est annoncé pour les abonnés Google AI Pro, quand Argon vise l’offre Ultra.
Ce que la restriction change sur un marché vendu sur la disponibilité
Depuis des mois, la livraison immédiate est l’argument. Anthropic a sorti Claude Opus 5 le 24 juillet, Claude Opus 5.5 le 22 septembre et son palier intermédiaire le 29 ; OpenAI a présenté GPT-6.1 Sol sept jours après GPT-6 Sol. Google joue l’inverse et parie sur un saut de plusieurs générations. Le risque saute aux yeux : quelques semaines suffiraient pour qu’un Claude Fable 5.1 ou un GPT-6.1 Astra reprenne la couronne avant qu’Argon ait servi une requête publique. De ces deux prétendants, l’un a déjà quitté le calendrier, OpenAI ayant renoncé le 28 septembre à GPT-6.1 Astra.
Réserver le modèle à des défenseurs permet alors de tenir un discours de puissance sans tenir un calendrier, et de requalifier un retard en précaution. Dominer les bancs d’essai n’a de toute façon jamais suffi : Google l’avait déjà fait avec Gemini 2.5 Pro puis Gemini 3 Pro sans retenir les développeurs exigeants, que ses concurrents ont captés en bâtissant autour du modèle outils de programmation et espaces d’exécution pour agents. Un bon modèle ne remplace pas l’outillage qui doit l’entourer, chantier que l’annonce n’évoque pas. Le terrain, lui, ne réclame pas ce qu’on lui promet : une enquête de février 2026 auprès de mille cinq cents responsables des systèmes d’information et de la sécurité relève que 14 % seulement autorisent une remédiation pleinement autonome.
Une annonce sans date n’est pas une sortie, et une diffusion aux défenseurs n’est pas une distribution. Ce que Google a rendu public le 30 septembre tient dans un graphique, un tarif d’introduction et un plafond de génération ; ce qu’il a mis en circulation tient dans un programme ouvert un mois plus tôt, auprès d’organisations qualifiées sur leur secteur et leur gouvernance, avec un modèle dégarni de ses protections cyber.
L’opération relève moins de l’avant-première que de la campagne d’observation en conditions extrêmes : les défenseurs ne paient pas, ils fournissent les journaux d’usage et la légitimité dont la démonstration de sûreté aura besoin. La posture dispense d’un calendrier et met l’éditeur à l’abri d’une vérification simple, puisqu’un modèle qu’on ne peut pas exécuter ne se laisse pas contredire.
Au-delà du cas, c’est la frontière entre mise sur le marché et mise à disposition qui se déplace. Le droit européen s’attache à la première, ses obligations sur les modèles à usage général ne disant rien du périmètre servi en premier ; le décret américain organise la seconde en amont. L’écart entre les deux dessine l’espace où un éditeur annonce une capacité sans avoir encore à la livrer.
Aller plus loin
L’annonce vaut d’être lue pour ce qu’elle tait autant que pour ce qu’elle affirme, et Gemini 4 Argon: our next era of frontier intelligence aligne un plafond de sortie à un million de jetons, un tarif d’introduction appelé à doubler, aucune taille de fenêtre de contexte, aucune date publique et aucune fiche modèle.
La question de savoir qui entre dans le cercle trouve sa réponse sur la page du Fairwind Program, qui énumère les trois catégories d’organisations éligibles, décrit la vérification d’antécédents sur l’historique de sécurité et le bilan éthique du candidat, et affiche le nombre de partenaires déjà admis.
Le processus volontaire invoqué par l’éditeur se lit intégralement dans le décret 14409 publié au Federal Register, dont la désignation classifiée des modèles couverts, la fenêtre pouvant aller jusqu’à trente jours d’accès fédéral et la sélection conjointe des partenaires de confiance forment le patron de la posture adoptée pour Argon.
Le mot volontaire mérite l’examen critique que lui consacre Voluntary Until the Government Is Your Customer, qui retrace la réduction de la fenêtre de quatre-vingt-dix à trente jours après lobbying, et montre comment la commande publique transforme une adhésion en condition d’accès aux marchés.
Avant de commenter un écart de trois points, mieux vaut consulter la revue de DeepSWE v1.1 par Epoch AI, qui classe défectueux le banc mis en vitrine, détaille le mécanisme de notation responsable de plus des trois quarts des erreurs relevées et précise que l’inspection s’est arrêtée dès le seuil de preuve franchi, sans chercher les autres types d’erreur.
Le résultat absent du graphique officiel est documenté par Gemini 4 Argon on FrontierSWE: Eureka and Third Place, qui place le modèle troisième sur des tâches allant jusqu’à vingt heures, publie le détail des passages individuels et rend visible une dispersion que les tableaux de synthèse effacent.
Le seul évaluateur réellement tiers du lot publie ses chiffres en continu, et le Vals Index accompagne chaque score d’un coût par test, ce qui déplace la comparaison du prix au jeton vers le prix d’une tâche menée à terme, et montre accessoirement qu’Argon y figurait avant son annonce publique.
La méthodologie du banc cyber où l’éditeur revendique la première place est exposée dans CWE-bench: Measuring Coding Agent Capabilities on Every Class of Known Vulnerability, qui décrit l’injection de vulnérabilités de même classe destinée à déjouer la mémorisation de correctifs connus et donne l’état de l’art au 2 septembre.
La grille que Google aurait pu citer pour justifier sa restriction est décrite dans Strengthening our Frontier Safety Framework, troisième version du cadre maison, qui expose les domaines de risque suivis, les seuils critiques de capacité et les paliers intermédiaires ajoutés le 17 avril 2026, sans qu’aucun d’eux ait été invoqué pour Argon.
Le précédent le plus proche, et sa différence décisive, tient dans Introducing Claude Fable 5.1 and Claude Mythos 5.1, où un même modèle sous-jacent se décline en version publique et en variante à garde-fous assouplis réservée à des organisations vérifiées : la restriction y porte sur le dérivé, pas sur le modèle phare.
Lus ensemble, ces documents décrivent moins une audace industrielle qu’une case déjà dessinée. Le droit américain a prévu la diffusion anticipée aux défenseurs, un programme de partenariat l’a outillée un mois avant l’annonce, et les évaluateurs indépendants montrent que la supériorité revendiquée dépend du choix des épreuves. Reste ce que personne ne documente : la date à laquelle un modèle annoncé comme le meilleur du marché deviendra un modèle qu’on peut utiliser.
