Un test de dépistage médical peut être excellent et se tromper la plupart du temps. La valeur prédictive d’un examen dépend moins de sa sensibilité que de la fréquence de la maladie dans la population examinée : sur un million de personnes dont mille sont atteintes, un test juste à 99 % en désigne près de onze mille. L’instrument n’a pas failli, la question posée n’était pas la sienne.
La détection des textes de machine connaît le même écart entre le laboratoire et le verdict individuel. Le 22 septembre 2026, un compte X nommé Balance ton Claude soutenait, analyses du logiciel Pangram à l’appui, que « C’était ça ou mourir », roman de Thélyson Orélien publié chez Grasset, sortait pour l’essentiel d’une machine. L’essayiste Samuel Fitoussi s’est déclaré à l’origine de la polémique ; des journalistes québécois ont par ailleurs mis en évidence plusieurs plagiats dans ses écrits antérieurs.
Le vendredi 25 septembre, l’Académie Goncourt écartait le titre de sa première sélection pour ces plagiats, en ajoutant qu’il lui paraissait « selon toute vraisemblance très largement le produit d’une intelligence artificielle ». L’auteur dément avoir fait appel à la machine. La même semaine, une expérience mise en ligne sur LinkedIn faisait échouer Victor Hugo à un test de détection, quand Maupassant et Baudelaire ressortaient à 100 % humain sur Pangram. Reste à savoir ce que mesure un tel instrument, ce que valent les taux d’erreur affichés, et ce qu’en font déjà universités, éditeurs et tribunaux.
Ce qu’un détecteur mesure, et ce qu’il ne dit pas
Un écart statistique entre une phrase et sa réécriture
Pangram est né en 2023 sous l’impulsion de Max Spero et Bradley Emi, deux anciens de Stanford. Leur méthode d’entraînement tient en un geste : réunir des millions de pages écrites par des humains, faire reformuler chacune par plusieurs modèles de langage, puis apprendre au classifieur à séparer l’original de sa copie. Ce qu’il retient relève de la régularité des constructions et des habitudes de vocabulaire, jamais du sens.
Leur premier rapport technique décrit 28 millions de documents antérieurs à 2022 et prévient que l’outil ne doit pas servir d’arbitre unique en intégrité académique. Celui de la quatrième version, publié fin juillet 2026, revendique une aire sous la courbe de 0,9916 sur 520 000 échantillons tout en décrivant les prédictions comme « dans une certaine mesure une boîte noire » : un même passage change parfois de classe selon le document où on l’insère.
Un score qui n’est pas une proportion de mots
Depuis la version 3.0, le nombre rendu n’est plus la part du texte attribuée à la machine : c’est un score de 0 à 1 mesurant la force de l’intervention, qui distingue retouches légères, modérées et lourdes. Un score de 94 % ne dit donc pas que 94 % d’un texte viennent d’une machine. L’entreprise décrit même une paternité mixte homogène, où mots humains et générés sont trop enchevêtrés pour être séparés.
Pourquoi un classique peut être versé du côté de la machine
La perplexité, ou le piège des textes trop lus
Beaucoup de détecteurs reposent sur la perplexité, ce degré de surprise d’un modèle devant chaque mot ; trop prévisible, un texte bascule du côté de la machine. Bradley Emi, directeur technique de Pangram, décrivait ce piège en mars 2025 : la Déclaration d’indépendance américaine, recopiée dans d’innombrables manuels, a tellement nourri les corpus d’entraînement que plus rien n’y surprend un modèle, et ces outils la rangent parmi les textes générés. Tombée dans le domaine public et dupliquée sur des milliers de sites, l’œuvre de Victor Hugo tend le même piège.
Ce que l’expérience des dix écrivains établit
Jean-Jacques Dulin, ingénieur retraité devenu conférencier en histoire des sciences, en intelligence artificielle et en esprit critique, a soumis dix grandes plumes françaises, toutes mortes avant l’informatique, aux critères qui repèrent une écriture de machine. Les scores varient d’un auteur à l’autre, alors qu’aucun de ces textes ne peut être suspect : à mesure que Flaubert lime sa phrase, en conclut-il, un instrument mal conçu la tient pour plus douteuse.
Le nom du logiciel employé n’est pas donné, et un commentateur a objecté qu’un détecteur de style ne vaut qu’au-delà de 70 à 80 % d’IA. Les Décrypteurs de Radio-Canada ont, eux, soumis à Pangram neuf classiques français, de Maupassant à Michel Foucault, ainsi que des chapitres entiers de la Bible : tous en sont ressortis humains à 100 %. Le cas Hugo atteste un biais des détecteurs bâtis sur la prévisibilité, pas une défaillance de l’outil mis en cause, qui réserve aux textes canoniques des tests dédiés. Next relevait en outre la circulation sur X de fausses analyses Pangram attribuées à Victor Hugo ou à Mary Shelley.
Des taux d’erreur, et ce qu’ils deviennent multipliés
Les chiffres de l’éditeur, les mesures des tiers
Sur le français, l’entreprise revendique 0,0026 % de faux positifs, chiffre issu de ses propres essais. Un billet du 15 septembre 2026 avance une erreur sur dix mille en général, une sur vingt-cinq mille sur l’écriture académique, contre 0,51 % pour Turnitin et 1 % pour GPTZero, au terme d’un protocole à trois étages, du jeu de test massif antérieur à 2022 aux cas difficiles.
Les mesures extérieures restent rares. Marzena Karpinska, professeure à l’université Simon Fraser, en avait trouvé 2 % lors des premiers essais indépendants, menés en 2024 ; elle dit depuis avoir « beaucoup de confiance envers Pangram, en particulier pour des textes plus longs ». Epoch AI n’en a relevé aucun sur des passages de 99 auteurs antérieurs à 2022, quand Originality.ai en produisait 3,8 %.
L’arithmétique qui rend un pourcentage lisible
Un taux ne devient intelligible qu’une fois multiplié par un volume. Vanderbilt l’a posé en août 2023 en désactivant le détecteur d’IA de Turnitin : 75 000 copies soumises en 2022 et 1 % de faux positifs auraient produit près de 750 accusations infondées en un an. Appliqué à la première sélection d’un prix littéraire, le calcul s’inverse. Ce qui change n’est pas la fiabilité de l’instrument, mais le nombre de personnes exposées et le prix d’une erreur.
Une erreur qui ne frappe pas au hasard
Les copies des non-anglophones
L’étude fondatrice sur les faux positifs, menée par Weixin Liang et ses collègues de Stanford, a soumis 91 dissertations TOEFL rédigées par des non-anglophones à sept détecteurs commerciaux : 61,3 % ont été classées générées par IA en moyenne, contre 5,1 % pour des copies d’élèves américains de quatrième. L’explication tient à la faible perplexité d’un vocabulaire contraint, le mécanisme même qui recale Victor Hugo.
Le précédent des cégeps et le paradoxe du style
Au Québec, le ministère de l’Enseignement supérieur a employé ces outils et signalé un nombre inhabituel de plagiats à l’épreuve uniforme de français. Pour la Fédération des cégeps, que dirige Marie Montpetit, la majorité des cas allégués étaient des faux positifs : les élèves accusés avaient composé en classe, sans accès à Internet ni téléphone. Le linguiste Thierry Poibeau y voit « un jeu du chat et de la souris » imposant de réentraîner sans fin, et l’écrivain Baptiste Beaulieu le paradoxe inverse : entraînés sur la littérature humaine, les modèles en reproduisent les figures, que le détecteur prend pour des marqueurs de machine.
Ce que les détecteurs laissent passer, et à quelle échelle ils valent
La faille symétrique reste hors du débat. Epoch AI a mesuré ce qui advient quand un modèle reçoit cinq textes d’un auteur pour en imiter le style : les détecteurs laissent alors passer 13 % des passages en moyenne, 10 % pour Pangram, 11 % pour GPTZero, 18 % pour Originality.ai, jusqu’à 26 % sur l’écriture scientifique. Une accusation fondée sur un score vise donc les usages maladroits et manque les soignés. Le résultat bouge aussi avec le soin apporté : le Journal du Net a ramené de 12 % à 0 %, une fois les faits vérifiés, un article rédigé par des agents d’IA, et un seul de ses 85 textes humains est passé à tort du côté de la machine, à 70 %, une interview transcrite automatiquement puis retravaillée.
L’usage où ces classifieurs convainquent est statistique, non judiciaire. En août 2026, le Pew Research Center a passé près de 490 000 pages anglophones au modèle ouvert Open Pangram et conclu qu’une sur dix porte la trace d’une écriture de machine, en prévenant qu’il se trompe parfois sur un document isolé et ne se lit qu’en masse. L’éditeur tient le même langage : ses analyses de masse, dit-il, décrivent des tendances agrégées et non des verdicts individuels.
Ce que les institutions font déjà d’un score
Substack héberge le classifieur de Pangram depuis juillet 2026 : ses lecteurs font examiner en quelques clics tout texte dépassant la centaine de mots. L’édition scientifique trie depuis plus longtemps. Springer Nature a déployé en novembre 2023 un outil interne surnommé Geppetto, qui note la cohérence de chaque section d’un manuscrit et a écarté des centaines de faux articles avant d’être donné au STM Integrity Hub en avril 2025. Le tri y déclenche une enquête humaine, jamais un verdict.
En juin 2026, la Commonwealth Foundation avait répondu sans détecteur à des accusations visant les lauréats régionaux de son prix de la nouvelle : entretiens sur la méthode de travail, examen des brouillons, des fichiers horodatés et des notes, rappel que sept personnes au moins avaient lu chaque texte. L’IA n’avait pas été utilisée. Les outils, écrit la fondation, peuvent servir d’indice mais « ne peuvent pas constituer à eux seuls une preuve concluante ».
Le communiqué de l’Académie Goncourt invoque de son côté « le résultat convergent de plusieurs analyses de chercheurs et journalistes dignes de foi », sans nommer ces chercheurs ni les outils. Le 28 janvier 2026, la Cour suprême de l’État de New York avait ordonné à l’université Adelphi d’effacer du dossier d’un étudiant une sanction fondée sur un signalement de Turnitin, quand deux autres détecteurs concluaient à un texte humain.
Ce qu’une accusation publique engage
Ce que la décision new-yorkaise censure tient à la procédure et non à la technologie : Orion Newby avait comparu sans accompagnant devant le même administrateur en première instance et en appel, et sa famille dit avoir dépensé six chiffres en frais de justice. La ligne de partage passe par le contradictoire, qu’un fil sur un réseau social n’offre pas.
Le précédent éditorial le confirme. « Shy Girl », roman d’horreur de Mia Ballard, autoédité en février 2025 puis repris par Orbit, filiale de Hachette, a été retiré de la vente après des accusations d’écriture par IA, premier cas connu d’un grand éditeur revenant sur un livre pour ce motif. L’autrice a reconnu qu’une personne engagée pour retravailler le texte avait employé ces outils, sans qu’on sache jamais comment le livre avait été écrit ; la chercheuse Natalie Wall relève le piège : un retrait décidé dans l’incertitude est lu comme une confirmation de culpabilité.
Le cas le plus proche date du 21 septembre 2026 : le journal étudiant The Dartmouth a soumis au même logiciel des textes de son prévôt, Santiago Schnell, dont plusieurs articles de 2026 ressortent entre 71 % et 100 % d’IA, quand ses travaux de 2012 à 2019 reviennent tous à 100 % humains. L’intéressé décrit un usage assistif, réservé au polissage de la langue. Écrit par une IA n’est donc pas une catégorie mais un curseur, et les membres de l’Académie Goncourt ont pourtant écrit aux jurys qui décernent ce prix, en France et à l’étranger : « Nous ne cautionnons ni n’adoubons […] la création de textes générés avec l’aide de l’IA. »
Deux propositions se sont confondues au fil de la semaine. Un détecteur ne dit pas qui a tenu la plume : il dit à quelle distance statistique un texte se tient de ce qu’un modèle aurait produit. La première question réclame des brouillons, des fichiers horodatés et des entretiens ; la seconde se lit sur un écran en quelques secondes. Rien n’interdit de partir de la seconde, à condition de ne pas s’y arrêter.
La deuxième sélection est attendue le 6 octobre, et l’Académie s’est engagée au silence jusque-là ; du côté du Renaudot et du Femina, rapportait Actualitté, aucun retrait n’était annoncé vendredi. Ce que diront les prochains jours tient moins au sort d’un livre qu’à une méthode : une institution qui écarte un titre sans nommer ses expertises s’expose au reproche même qu’elle adresse à l’auteur, ne pas montrer sur quoi son travail repose.
Marzena Karpinska a prévenu Radio-Canada : « Nous ne pouvons pas dire avec 100 % de certitude que c’est de l’IA. » La même chercheuse a montré que cinq lecteurs rompus à l’usage quotidien des modèles battent la plupart des détecteurs commerciaux, une erreur sur 300 textes, en s’appuyant sur des critères qu’aucun classifieur n’évalue. L’essentiel des chiffres de référence est publié par le vendeur : une accusation publique repose sur une métrologie que celui qu’elle vise ne peut pas vérifier.
Aller plus loin
Les chiffres invoqués dans la polémique viennent du même document, à lire en entier : le rapport technique de Pangram 4 expose l’aire sous la courbe de 0,9916 et les 520 000 échantillons, mais aussi l’aveu qu’il reste « dans une certaine mesure une boîte noire » et qu’un passage change de classe selon le document où on l’insère.
L’étude qui a ouvert le dossier des faux positifs reste la plus utile pour comprendre le cas Hugo, puisque GPT detectors are biased against non-native English writers établit que 61,3 % des dissertations TOEFL de non-anglophones sont classées générées, contre 5,1 % pour des copies natives, et impute l’écart à la faible perplexité d’un vocabulaire contraint.
La faille inverse tient dans une mesure externe récente, où AI detectors rarely flag human writing, but sometimes miss AI text imitating real authors ne relève aucun faux positif sur 99 auteurs antérieurs à 2022, mais 10 à 18 % d’échecs dès qu’un modèle reçoit cinq échantillons d’un style pour l’imiter.
Pour une institution, la bonne question n’est pas le taux moyen mais le plafond qu’elle s’impose, et c’est l’apport du document de travail Artificial Writing and Automated Detection, où Brian Jabarian et Alex Imas comparent quatre détecteurs sur 1 992 textes humains antérieurs à 2020 et éprouvent la tenue d’un plafond réglementaire strict.
Le marché manque d’un terrain d’essai commun, et ce manque se mesure dans RAID: A Shared Benchmark for Robust Evaluation of Machine-Generated Text Detectors, six millions de générations et onze attaques adverses, dont les auteurs relèvent que les annonces à 99 % ne sont presque jamais confrontées à un jeu partagé.
L’usage où ces outils tiennent leurs promesses apparaît dans How Much of the Internet Is Written With AI?, 490 000 pages passées au modèle ouvert Open Pangram, assorti de l’avertissement qui manque partout ailleurs : le classifieur se trompe sur le document isolé et ne se lit qu’en masse.
L’arithmétique qui convertit un pourcentage en personnes accusées à tort tient dans la note Guidance on AI Detection and Why We’re Disabling Turnitin’s AI Detector, où l’université pose ses 75 000 copies annuelles contre 1 % d’erreur, puis énumère les pratiques à mettre à la place.
Le premier précédent judiciaire clair est raconté par Adelphi Student Wins AI Plagiarism Lawsuit, où un tribunal new-yorkais ordonne l’effacement d’une sanction fondée sur un signalement de détecteur, deux autres outils ayant conclu à l’inverse, et censure la procédure, non la technologie.
Le contre-protocole existe, écrit noir sur blanc par un jury littéraire confronté aux mêmes accusations : la mise au point de la Commonwealth Foundation sur son prix 2026 détaille les entretiens, les brouillons, les fichiers horodatés et les notes examinés, et pose que les détecteurs ne sauraient constituer à eux seuls une preuve concluante.
Le scénario complet a déjà eu lieu dans l’édition anglophone, et Natalie Wall l’analyse dans A popular horror novel was pulled over AI concerns, où un retrait décidé faute de certitude finit par tenir lieu, aux yeux du public, de preuve de la culpabilité.
Lus ensemble, ces travaux décrivent un instrument honnête sur ce qu’il fait et détourné de ce qu’il sait faire. Il excelle à estimer une proportion sur un demi-million de documents, il hésite sur un exemplaire, il se trompe d’abord sur ceux qui écrivent dans une langue apprise, et il rate les imitations les mieux préparées. Ce qui manque n’est pas une meilleure mesure : c’est une procédure qui accepte le doute, expose ses pièces et laisse une place à celui qu’elle vise.
