En 1883, dans La Cryptographie militaire, Auguste Kerckhoffs posait qu’un système de chiffrement ne doit pas exiger le secret et doit pouvoir tomber aux mains de l’ennemi sans inconvénient. La discipline en a tiré une règle : on tient l’algorithme pour connu de l’adversaire, on le livre à l’examen de tous, et seule la clé reste secrète, puisque la force du système ne dépend pas de ce que l’adversaire ignore.
L’intelligence artificielle de frontière n’a pas adopté cette règle : en cybersécurité, ses éditeurs les plus avancés font plutôt l’inverse. Pour leurs modèles les plus capables, l’accès se mérite, par des programmes d’habilitation, des listes de défenseurs agréés, des versions aux garde-fous allégés confiées à quelques organisations. Distribuer les poids d’un modèle, c’est renoncer à ce contrôle, puisque chacun en détient alors une copie complète : tel est le pari de Mistral AI.
Mistral AI, la jeune pousse française, a présenté le mardi 6 octobre Mistral Large 4, surnommé le Chonk : un modèle nativement multimodal de mille milliards de paramètres, ouvert à tous par l’API dès l’annonce, dont les poids, promis pour la fin du mois, doivent devenir accessibles aux entreprises comme aux chercheurs. Son cofondateur admet que le modèle ne comble pas tout l’écart avec les modèles de frontière, et son PDG assure qu’il devance les modèles chinois dans certains domaines, la cybersécurité en tête. Restent à établir ce que le modèle est, ce que Mistral revendique et ce que des tiers ont mesuré, où se loge le contrôle quand les poids circulent, et ce qu’en disent l’échelle du modèle et le droit européen.
Un modèle accessible par l’API avant d’être ouvert par ses poids
Architecture, entrées multimodales, sortie en texte
Large 4 est un mélange d’experts hybride, conçu pour les instructions, le raisonnement et les agents : à chaque jeton, il n’active qu’une fraction de ses 1 000 milliards de paramètres, 49 milliards selon le message publié sur X le jour du lancement, 52 selon le billet détaillé de Mistral. Il couvre plus de cent soixante langues, dont toutes les langues officielles de l’Union européenne, accepte en entrée images, documents, tableurs, graphiques et dessins techniques, mais ne produit que du texte, ce que Guillaume Lample a confirmé à VentureBeat. L’audio, que certains comptes rendus ajoutent, ne figure pas dans le billet détaillé.
Tarif, contexte, licence et calendrier des poids
L’API facture 1,36 dollar le million de jetons en entrée et 4,18 dollars en sortie, soit 68 % et 42 % du tarif de GPT-6.1 Sol, à 2 et 10 dollars ; une remise de lancement de 50 % s’applique pendant deux semaines. Le billet détaillé ne chiffre pas la fenêtre de contexte, que la documentation de Mistral situe à un million de jetons, contre 256 000 pour Large 3, et ne nomme aucune licence. VentureBeat écrit que les poids sont attendus sous une licence propre à Mistral. Le précédent est contrasté : Large 2, en juillet 2024, avait paru sous une licence de recherche, l’usage commercial exigeant un accord séparé, et Large 3, en décembre 2025, sous Apache 2.0.
Les poids doivent suivre à la fin du mois : Mistral parle de la fin octobre, VentureBeat du 27, au terme d’une période d’essai d’environ trois semaines. L’apprentissage par renforcement qui a produit l’aperçu se poursuit pendant ce délai, de sorte que les poids publiés pourraient différer de l’aperçu actuel.
Un écart reconnu, une avance revendiquée sur les modèles ouverts
Ce que Mistral revendique
Auprès du Figaro, le cofondateur Guillaume Lample concède que le Chonk reste en deçà de ChatGPT et de Claude : un modèle qui « ne comble pas complètement l’écart avec les modèles frontières, mais le réduit significativement ». Le PDG Arthur Mensch assure de son côté que le modèle fait mieux que les modèles chinois sur certains terrains, la cybersécurité par exemple.
Le vice-président chargé de la science, Pierre Stock, vante un niveau de pointe en cybersécurité, dans les processus industriels et en finance, et classe le modèle dans le peloton de tête mondial des modèles ouverts sur les évaluations agrégées. Le message du lancement resserre le classement : meilleur modèle à poids ouverts américain ou européen, ce qui laisse les modèles chinois de côté. Il ajoute que le modèle surpasse les modèles fermés de frontière en ancrage visuel ; le billet chiffre l’avance à un point sur GPT-6 Astra, 42 % contre 41 % au test Dense 200.
Ce que montrent les chiffres et les tiers
Sur le code, les résultats publiés par Mistral sont ceux d’un modèle qui ne mène pas, sauf face à deux modèles chinois : 61,7 % sur DeepSWE v1.1, 49,8 % à l’indice des agents de code, devant DeepSeek V4 Pro 0813 et Qwen3.8 Max. Le classement en ligne de DeepSWE affiche GLM-5.3 et Kimi K3 vers 69 % et plusieurs modèles fermés vers 74 %, nettement plus que Large 4, relève VentureBeat, qui rappelle que les scores dépendent du cadre d’essai. À la parution de son compte rendu, le 6 octobre à 6 h, heure du Pacifique, Large 4 ne figurait encore ni sur ce classement ni dans les évaluations publiques d’Artificial Analysis.
Une évaluation humaine en aveugle du code, menée par Surge AI et rapportée par Mistral, nuance le tableau : sur une échelle de 1 à 5, l’aperçu de Large 4 obtient 3,74 et se classe deuxième des cinq modèles comparés, devant GLM-5.3 (3,60) et Kimi K3 (3,59), mais loin de Claude Opus 5 (4,22). L’écart avec les modèles chinois change donc de signe selon l’épreuve, celui avec les modèles fermés reste net. En finance et en droit, Mistral invoque les évaluations de vals.ai : le modèle dépasserait GPT-6 Astra et, au banc de Harvey, tous les modèles ouverts, Large 4 réussissant 15 % des tâches selon VentureBeat.
La cybersécurité, terrain choisi pour la comparaison
Mistral dit placer Large 4 parmi les cinq premiers modèles du monde à l’Artificial Analysis Cyber Index et, de loin, en tête des modèles à poids ouverts hors de Chine. Cet indice, publié en septembre 2026, ne mesure que la défense, par trois évaluations à poids égaux d’audit et de correction de failles, et compte les refus à part : il dit comment un modèle sert un défenseur, non ce qu’il apporterait à un attaquant.
Au test de reproduction puis de correction d’une vulnérabilité, Mistral affiche 82 %, le meilleur score selon elle, tandis que Claude Opus 5.5 et GPT-6 Astra, affirme-t-elle, obtiennent à ce même test un score proche de zéro parce qu’ils refusent la tâche ; elle y ajoute 93 % des 40 défis de Cybench. Le score de 82 % mêle donc capacité et politique d’usage : refuser la tâche, c’est marquer zéro. Pour la sécurité du modèle, Mistral cite 93,3 % de résistance aux attaques au benchmark B3 de Lakera, mesure rapportée pour l’aperçu et non pour les poids à venir.
Où loge le contrôle quand les poids circulent
Habilitation chez les uns, poids chez Mistral
Chez les éditeurs fermés, l’accès aux modèles les plus capables en cyber se gagne : OpenAI a classé le 29 septembre GPT-6.1 Sol au niveau critique en cybersécurité et le déploie de façon phasée par son programme Daybreak, et Google a réservé le 30 Gemini 4 Argon aux défenseurs de confiance de son programme Fairwind, sans date d’ouverture au public. L’autre camp s’était exprimé en juillet : la lettre ouverte du 24, que Mistral a signée et que cinquante-deux organisations ont ensuite rejointe, puis l’Open Secure AI Alliance lancée le 27 par NVIDIA ont défendu les modèles ouverts comme des atouts pour la défense plutôt que comme un passif.
Mistral n’échappe pas pour autant à l’habilitation. Avant la publication des poids, des dirigeants de la cybersécurité, des partenaires vérifiés et des autorités étatiques éprouvent le modèle en red teaming et y accéderont avec une modération réduite et des capacités cyber étendues ; les organisations pourront l’auto-héberger selon leurs propres règles. Pierre Stock promet un travail conjoint avec des gouvernements et des partenaires de confiance, afin que le modèle appuie la défense plutôt que l’attaque. L’accès réservé existe donc chez Mistral aussi, mais pour la version à modération réduite, non pour le modèle.
Une modération apprise se retire
La différence avec OpenAI et Google tient moins à l’opposition entre ouvert et fermé qu’à l’endroit où se loge le contrôle : chez l’éditeur, qui héberge le modèle sur ses propres machines, comme OpenAI ou Anthropic, et peut donc identifier les clients, journaliser et couper l’accès, ou chez l’utilisateur, qui récupère une copie complète et en fait ce qu’il veut, au risque que des acteurs malveillants s’en servent aussi. Or un refus appris se retire : Tamirisa et ses coauteurs rappelaient en 2024 que quelques pas de fine-tuning suffisent à défaire refus et désapprentissage. Les mesures de sécurité de Mistral décrivent donc l’aperçu de l’API, non ce qui circulera après la publication des poids.
L’argument inverse existe : Wallace et ses coauteurs, chez OpenAI, ont conclu en août 2025 qu’un fine-tuning malveillant de gpt-oss n’avançait pas substantiellement la frontière des modèles ouverts existants. Pour Kimi K3, l’évaluation préliminaire du 23 juillet du UK AI Security Institute et du CAISI américain a constaté que les garde-fous n’avaient pas empêché les tentatives d’exploitation offensive, le modèle menant une attaque complète à son terme sur un essai sur dix. À ce stade, aucune évaluation de ce type n’est publiée pour Large 4.
L’échelle, la souveraineté et le droit européen
Une frugalité relative, une souveraineté assumée
Mistral revendique aussi la frugalité du modèle : environ 4 000 puces NVIDIA selon la presse, 3 800 GPU Grace Blackwell dans le billet détaillé, un parc deux à trois fois plus réduit que celui de ses concurrents chinois et sensiblement moindre que celui des éditeurs fermés. Mais Kimi K3, publié par Moonshot le 16 juillet, compte 2 800 milliards de paramètres dont environ 104 milliards actifs, soit près de trois fois la taille de Large 4 et deux fois ses paramètres actifs : la frugalité se mesure à l’échelle des plus grands modèles chinois, non à un coût absolu.
Le message du lancement présente un modèle forgé de bout en bout en Europe et déployable depuis l’Europe, sur l’infrastructure cloud de Mistral, dont Microsoft loue des capacités depuis l’accord de plusieurs milliards de dollars annoncé en juillet et que la série D de 3 milliards d’euros doit étendre. Le pari est aussi politique : prouver que l’Europe, et la France d’abord, ont encore leur place dans une course à l’IA que dominent les géants américains.
Droit européen et données d’entraînement
À cette taille, les poids occupent environ un téraoctet à raison d’un octet par paramètre (FP8), ce qu’un nœud de huit GPU de classe B200 accueille en principe : à la portée d’une entreprise ou d’un laboratoire, non d’un particulier. Au-delà de 10^25 FLOP d’entraînement, le règlement européen sur l’IA présume un modèle à risque systémique et lui retire l’exemption des modèles ouverts, la Commission pouvant sanctionner depuis le 2 août 2026 ; la règle usuelle, six fois les paramètres actifs par le nombre de jetons, place ce seuil vers 32 000 milliards de jetons pour 52 milliards de paramètres actifs, et Mistral n’a pas publié ce nombre. Publier des poids n’ouvre pas non plus les données, ce que l’European Open Source AI Index reprochait à Large 3 en parlant d’open-washing.
Large 4 se présente moins comme un rival des modèles fermés que comme le meilleur des modèles ouverts occidentaux : l’écart avec les modèles de frontière est reconnu par ses auteurs, l’avance sur les modèles chinois dépend de l’épreuve, et les revendications en cybersécurité reposent sur des mesures que Mistral rapporte seule. Il offre une combinaison : proche de la frontière, téléchargeable, déployable depuis l’Europe, et entraîné, dit Mistral, sur moins de puces que ses plus gros rivaux.
Ce que vaut cette combinaison se décidera à la publication des poids. Une licence Apache 2.0 ouvrirait l’usage commercial sans restriction de domaine ni de taille, une licence propre pourrait en fixer les bornes, comme celle de Large 2. Les poids pourront différer de l’aperçu, les premières évaluations indépendantes diront si le Chonk tient les chiffres du 6 octobre, et la version téléchargée, hors du cadre de modération de l’API, montrera ce que ses garde-fous valent chez l’utilisateur.
La cryptographie sert ici de contre-exemple : la publication y protège parce que la sécurité tient à une clé que l’attaquant n’a pas, alors qu’un modèle ouvert remet à chacun l’algorithme et les moyens d’en retirer les refus. L’ouverture ne se juge donc plus au seul accès aux poids : elle dépend de la licence, des données que personne ne voit, d’évaluateurs capables de mesurer ce que l’éditeur annonce et d’un règlement européen dont l’application aux modèles ouverts commence tout juste. C’est là que se jouera la crédibilité d’un pari européen qui promet à la fois la frontière, la souveraineté et l’ouverture.
Aller plus loin
L’annonce vaut d’être lue pour ce qu’elle chiffre autant que pour ce qu’elle tait : le billet Introducing Mistral Large 4 donne les 52 milliards de paramètres actifs, les 3 800 GPU Grace Blackwell, le tarif, les résultats rapportés par Mistral et l’accès à modération réduite, mais ne nomme ni licence ni fenêtre de contexte.
La filiation du modèle se lit dans Introducing Mistral 3, qui décrit Large 3 : un mélange d’experts de 675 milliards de paramètres dont 41 milliards actifs, entraîné de zéro sur 3 000 GPU H200 et publié sous Apache 2.0, classé deuxième des modèles ouverts non raisonnants au classement LMArena d’après Mistral.
Pour savoir ce que mesure l’indice invoqué en cybersécurité, la page Artificial Analysis Cyber Index Benchmarking Methodology expose la version 1.0 : défense seulement, aucune tâche d’exploitation, trois évaluations à poids égaux, refus comptés à part, jeux de données en partie privés.
Le régime d’accès d’OpenAI se lit dans Addendum to GPT-6 Astra System Card: GPT-6.1 Sol, qui rattache le classement critique en cybersécurité à un déploiement phasé par le programme Daybreak, sous la même pile de garde-fous qu’Astra.
Le plaidoyer de l’autre camp figure dans Industry Leaders Unite in Open Secure AI Alliance for AI Safety and Security, texte fondateur qui présente les modèles ouverts, les outils et les harnais de sécurité comme des atouts défensifs, illustre la thèse par l’incident de Hugging Face, où un modèle ouvert a permis d’analyser plus de 17 000 actions, et nomme Mistral parmi les partenaires.
La fragilité des refus appris dans un modèle téléchargeable est documentée par Tamper-Resistant Safeguards for Open-Weight LLMs, article publié en août 2024 et retenu par l’ICLR 2025, qui rappelle que refus et désapprentissage s’effacent en quelques pas d’affinage et propose la méthode TAR pour y résister, même après des centaines de pas.
Le contrepoint vient de Estimating Worst-Case Frontier Risks of Open-Weight LLMs, où des chercheurs d’OpenAI décrivent le fine-tuning malveillant comme méthode pour estimer, avant publication, le risque marginal d’un modèle ouvert, et concluent que gpt-oss n’avance pas substantiellement la frontière des modèles ouverts existants.
L’évaluation d’un modèle ouvert chinois par des instituts d’État, avant même la publication de ses poids, tient dans UK AISI / CAISI Preliminary Assessment of Kimi K3’s Cyber Capabilities, qui chiffre les résultats, en précise les limites et constate que les garde-fous de Kimi K3 n’ont pas empêché les tentatives d’exploitation offensive.
Le cadre européen est exposé dans Guidelines on obligations for General-Purpose AI providers, page de la Commission mise à jour en novembre 2025, qui rappelle le seuil de 10^25 FLOP, précise que l’exemption open source ne vaut pas pour les modèles à risque systémique et indique que les sanctions s’appliquent à partir du 2 août 2026.
La notion d’ouverture est contestée dans Mistral 3: A Heavyweight Model, Lightweight on Openness, analyse de l’European Open Source AI Index qui reproche à Mistral de publier les poids de Large 3 sans les données d’entraînement, parle d’open-washing et juge que, sans données documentées, l’évaluation des performances et les tests de conformité sont impossibles.
Lus ensemble, ces documents dessinent un modèle dont presque tous les chiffres viennent de son éditeur, un indice qui mesure la défense et non l’attaque, des refus appris que la recherche dit fragiles, un contrepoint centré sur le risque marginal et un cadre européen encore à éprouver pour les modèles ouverts. Ils laissent ouvertes trois questions que les prochaines semaines éclaireront : la licence, l’écart entre l’aperçu et les poids, la première évaluation indépendante.
