En histoire naturelle, une part des espèces décrites chaque année ne sort pas du terrain mais des tiroirs : le spécimen dormait depuis des décennies sous une étiquette approximative, et il a fallu qu’un spécialiste rouvre le carton pour que l’animal existe dans la littérature. Produire une donnée et la regarder sont deux métiers, et le second est de loin le plus rare.

La biologie moléculaire s’est fabriqué un tiroir démesuré. Les bases de séquences doublent tous les quatre ans, les pipelines d’annotation ne repèrent que la nouveauté qu’on leur a prescrite à l’avance, et les recensements systématiques finissent par une curation experte manuelle dont le volume ne suit pas. Depuis juillet 2024, l’assemblage Logan a converti en contigs interrogeables la quasi-totalité des accessions du Sequence Read Archive : la matière à regarder a cessé d’être le problème.

Le 24 septembre 2026, Anthropic a annoncé qu’un essaim d’agents fondés sur son modèle Claude avait repéré un complexe enzymatique inconnu dans le génome de bactériophages, ces virus dont les bactéries sont les seules proies : ART, pour array-associated reverse transcriptases, des transcriptases inverses associées à des réseaux de répétition, dont l’entreprise rapproche les propriétés de CRISPR. Restent à examiner ce que la campagne a produit, ce que l’objet est et n’est pas, ce que la paillasse a confirmé, ce que l’instrument ne sait pas refaire, et ce qu’une communauté exige avant de tenir une découverte pour acquise.

Ce que la campagne a réellement produit

Les chiffres qui circulent et ceux du document

La version qui circule est simple : 950 agents lâchés sur un gisement de séquences colossal, 21 heures de calcul, quelque 210 millions de jetons consommés, et l’un d’eux tombe sur la famille qui recevra le nom d’ART, quand un chercheur seul y aurait passé plusieurs semaines ou plusieurs mois. Le récit est juste dans ses ordres de grandeur et se trompe sur l’unité qu’il compte.

Le preprint donne 949 sessions d’agents, ce qui n’est pas 949 agents : une session est une exécution, et 77 heures-agent pour 949 sessions placent la moyenne autour de cinq minutes. Le reste tient en trois nombres, 119 tâches, 215,6 millions de jetons, 21,5 heures de temps réel. Non pas une armée de chercheurs artificiels, mais un très grand nombre de coups d’œil très courts.

Le pipeline, et son rendement

Le parcours est chiffré de bout en bout : 52 profils HMM bâtis par les agents eux-mêmes, 1,94 milliard de clusters de protéines passés au crible, le voisinage de 10 983 loci recensé, 3 564 familles de partenaires candidates dont dix-sept promues en analyse approfondie. Trois seulement seront confirmées comme des associations jamais décrites, les quatorze autres tombant en artefacts d’annotation ou en voisins d’îlot de défense. Moins d’un vrai positif sur cinq : l’instrument réclame derrière lui le crible expert qu’il prétendait désengorger.

La piste fausse, la réfutation et le rebond

ART n’a pas été trouvé en suivant la mission, mais après l’avoir manquée. Le candidat initial était l’adjacence entre une transcriptase inverse et une sous-unité de l’ARN polymérase non-virionnaire des jumbo-phages ; un agent a réfuté lui-même cette lecture, « The “retron accessory” interpretation dies », avant d’ouvrir de sa propre initiative une tâche de suivi sur l’enzyme orpheline.

C’est en lisant l’ADN en amont des parents proches de cette RT qu’un autre agent a écrit : « I can see by eye a tandem repeat array. » Le locus n’était pourtant pas inédit : le génome du phage MarsHill avait été séquencé et publié, son article d’origine identifiait l’enzyme et proposait même un ARN non codant en 5’, sans décrire les répétitions. La donnée attendait ; c’est l’attention qui manquait.

L’anatomie d’ART et la distance avec CRISPR

Une enzyme qui remonte le courant

Une transcriptase inverse recopie l’ARN en ADN, à rebours du sens ordinaire du vivant, où la double hélice demeure à couvert et où seul l’ARN qu’on en tire sert de patron aux protéines. On connaît surtout ces enzymes chez les rétrovirus, le VIH en tête. Le recensement porte sur 95 clusters de RT distincts, logés dans des jumbo-phages, dont 28 seulement portent un réseau détectable : de 0,3 à 4,1 kilobases, 3 à 21 copies d’une répétition de 15 à 49 nucléotides, espaceurs tous différents. L’enzyme porte en outre une extrémité N-terminale d’environ 180 résidus sans repliement connu, flanquée de trois familles de partenaires sans parenté entre elles.

Une architecture qui ressemble, une fonction qui ne ressemble pas

La comparaison mise en avant est celle de CRISPR, ces ciseaux moléculaires qui coupent et réécrivent une séquence à l’endroit voulu, qui ont valu à la Française Emmanuelle Charpentier et à l’Américaine Jennifer Doudna le prix Nobel de chimie en 2020. Les répétitions d’un réseau CRISPR sont pourtant quasi identiques, à bords nets, séparées par des espaceurs d’une trentaine de nucléotides gagnés et perdus d’une souche à l’autre ; ceux d’ART font 120 à 220 nucléotides et se conservent dans le même ordre entre phages apparentés. Surtout, aucun gène cas ne figure près d’aucun locus.

« At this point in time, we can say that ART is CRISPR-like in its architecture, but there is no evidence that it is CRISPR-like in its function », tranche Dimitri Perrin, de la Queensland University of Technology, qui rappelle que l’enzyme était déjà connue, la nouveauté tenant à son appartenance possible à un système plus vaste. Kevin Blake, de la Washington University School of Medicine, refuse tout raccourci : « There’s nothing to indicate this is a rival to CRISPR-the-technology. »

Ce qui tient à la paillasse et ce qui reste une hypothèse

Deux expériences et un laboratoire

La vérification tient en deux gestes. Une réanalyse de données publiques d’abord : dans une cinétique d’infection du phage SA1 sur Staphylococcus lentus, déposée sous le BioProject PRJNA836150, les ARN du réseau atteignent 8 % des ARN du phage à la quinzième minute. Une expérience propre ensuite : le système exprimé sur plasmide chez Escherichia coli produit les mêmes ARN courts et discrets.

Le tout a été fait dans un laboratoire humide de la baie de San Francisco, confirmé le 18 septembre 2026 par Eric Kauderer-Abrams, responsable des sciences du vivant de l’entreprise : « the final test is still and will be for a while in real lab work. » Le lieu opère aux niveaux de biosécurité BSL-1 et BSL-2 et la paillasse y reste tenue par des humains.

Ce qui n’a pas été montré

La discussion écrit noir sur blanc ce qui manque : « we have not shown that the RT is active or that the unit RNAs are its substrates. Whether the RT and its partner interact, and what the system does for the phage, are currently unknown. » Le mécanisme proposé, calqué sur les rétrons où une RT, un ARN non codant et un effecteur tuent la bactérie infectée pour sauver la population, reste une hypothèse en pointillés. Entre une adjacence de séquences et une caractérisation aboutie, il y a tout le travail expérimental.

Le résultat que l’instrument ne sait pas refaire

Zéro sur dix

Les auteurs ont relancé dix fois la même campagne. Presque toutes celles qui sont allées au bout du recensement ont échantillonné des loci ART, deux ont même ouvert une tâche de suivi sur cette lignée, et aucune n’a lu l’ADN en amont : « the array was missed in every rerun. » La reproductibilité séparant une observation d’un résultat, l’aveu pèse plus lourd que la performance.

Plus d’outils, moins de regard

Avec les loci écrits directement dans le contexte, les modèles les plus capables décrivent le réseau dans au moins 90 % des tentatives ; les mêmes données rangées en fichiers, avec des outils pour les interroger, font tomber le taux jusqu’à 32 %, parce que dans 39 % des tentatives outillées le modèle n’a jamais lu 200 nucléotides d’affilée, donc jamais plus d’une unité. Franchir ce seuil vaut 16 à 32 points ; et plus le modèle lit d’ADN, plus il reconnaît le réseau, de 29 % jusqu’à 76 % pour les quatre meilleurs réunis, 96 % pour celui de la campagne. Les auteurs nomment genomic vision cette lecture directe de la séquence et en font la condition de la découverte.

Deux instruments pour la même architecture

La veille de l’annonce, le 23 septembre 2026, une équipe de Stanford, de l’Arc Institute et du Joint Genome Institute déposait sur bioRxiv un preprint décrivant Minerva, une fouille coévolutive fondée sur un modèle de langage génomique, qui rapporte à côté de transcriptases inverses du groupe UG27 des réseaux d’ARN non codants à structure conservée. La validation y va plus loin : cinq systèmes exprimés chez Escherichia coli produisent de courts ADN simple brin que la désactivation de l’enzyme efface.

Le preprint d’ART reconnaît cette antériorité, de tels réseaux ayant été, écrit-il, « recently discovered beside the unrelated UG27 RTs using a bespoke genome language model ». L’architecture est donc apparue plus d’une fois dans la nature, et la différence revendiquée n’est pas la trouvaille, mais l’instrument.

Ce qu’une communauté exige avant de tenir une découverte pour acquise

Le document s’intitule Autonomous AI agents discover reverse transcriptases with tandem repeat arrays et porte les signatures de Peter H. Yoon, Januka S. Athukoralage, Emmanuel Ameisen, Eric Kauderer-Abrams, Nicholas T. Perry et Matthew G. Durrant. Diffusé en PDF auto-hébergé le jour même, sans dépôt sur bioRxiv ni soumission à une revue, il n’a pas été relu par les pairs. Feng Zhang, du MIT et du Broad Institute, le juge « genuinely intriguing ».

Deux précédents encadrent ce genre d’annonce. En novembre 2023, une équipe de Google annonçait dans Nature 2,2 millions de structures cristallines nouvelles ; le 23 avril 2024, Anthony Cheetham et Ram Seshadri en examinaient un échantillon aléatoire et concluaient à « scant evidence for compounds that fulfill the trifecta of novelty, credibility, and utility ». Le 19 février 2025, à l’inverse, l’équipe de José Penadés montrait qu’une hypothèse produite par une intelligence artificielle retrouvait un mécanisme que ses expérimentateurs avaient mis des années à établir.

Reste l’unité de mesure. Les répétitions de CRISPR ont été repérées chez Escherichia coli par Yoshizumi Ishino en 1987 sans que leur rôle soit compris, leur fonction immunitaire démontrée par Rodolphe Barrangou en 2007, l’édition programmable publiée en 2012 par Martin Jinek, Jennifer Doudna et Emmanuelle Charpentier, le Nobel décerné en 2020 : vingt-cinq ans de la répétition à l’outil.

Le double usage tient à la même compétence

Au rang des inquiétudes que suscite l’intelligence artificielle, la plus sombre reste le concours qu’elle pourrait prêter à la fabrication d’armes biologiques, et lire des séquences brutes à grande échelle pour y repérer une anomalie est précisément le geste qui sert la recherche et la menace. Le rapport de renseignement sur les menaces du 10 septembre 2026 décrit cinq cas d’usage détourné en biologie : adaptation aux mammifères de la grippe aviaire hautement pathogène, gain de fonction sur le chikungunya, travaux sur les orthopoxvirus depuis un laboratoire lié à un État.

Un travail de red teaming déposé le 20 juillet 2026 ajoute que certaines conceptions biologiques produites par les modèles « are not merely textual artifacts, but can be physically realized under controlled experimental settings ». Les parades restent procédurales : biosécurité basse, humains à la paillasse, criblage des commandes de synthèse, et le Model Hardware Standard du 27 août 2026, qui loge les limites de sécurité dans le pilote. Des garde-fous d’organisation, pas des propriétés du modèle.

La question que soulève l’annonce, celle d’une révolution en cours dans la façon de faire de la science, se déplace dès qu’on regarde la mécanique. Rien dans ART n’a été créé : l’enzyme existait, son locus avait été séquencé et publié, les répétitions attendaient dans un fichier public. Ce qui a changé tient à une ressource que personne ne comptait, soixante-dix-sept heures passées à regarder ce que personne n’avait le temps de regarder.

« To me, that’s the opportunity: scaling scientific attention », résume Bo Wang, de l’université de Toronto. La proposition est économique avant d’être biologique, et son prix est visible : trois associations authentiques sur dix-sept réclament un expert derrière l’instrument, et un dispositif qui manque sa trouvaille dix fois sur dix ne délivre pas une méthode, seulement des candidats à vérifier.

Ce qu’attend la communauté n’a rien d’exotique : démontrer que l’enzyme est active, établir que les ARN du réseau sont ses substrats, vérifier que la RT et son partenaire interagissent, comprendre ce que le système apporte au phage. Deux équipes ont décrit en deux jours des architectures voisines avec des instruments sans rien de commun : ce qui affleure là n’est peut-être pas un système, mais une classe entière d’objets restée invisible tant que personne ne lisait l’espace entre les gènes.

Aller plus loin

Le document primaire tient en quarante pages qu’aucun comité de lecture n’a filtrées, et on trouve dans Autonomous AI agents discover reverse transcriptases with tandem repeat arrays les chiffres exacts de la campagne, les transcriptions d’agents et l’aveu des auteurs de n’avoir démontré ni l’activité de l’enzyme ni la fonction du système.

La seule couverture du jour à citer des contradicteurs nommés, Claude Found a Mysterious CRISPR-Like System, but Anthropic Can’t Say What It’s Capable of, réunit les objections : enzyme déjà connue, aucun rival thérapeutique en vue, et l’attention scientifique pour vraie ressource.

Déposé la veille par Stanford, l’Arc Institute et le Joint Genome Institute, le travail Coevolutionary mining of prokaryotic non-coding elements with a genome language model décrit les mêmes réseaux d’ARN non codants près d’autres transcriptases inverses, par une tout autre méthode, et pousse la validation jusqu’au retrait des protéines accessoires.

Pour mesurer ce qui manque encore, l’étude Molecular mechanism of the type 2 defense-associated reverse transcriptase montre à quoi ressemble un système de ce genre réellement caractérisé : structure cryo-électronique, triade catalytique identifiée, mécanisme de copie décrit pas à pas, origine phylogénétique établie.

La famille d’hôtes où ART a été trouvé a sa revue de référence, et The biology of jumbo phages explique pourquoi ces génomes géants, avec leur noyau de chimalline et leur arsenal anti-défense, forment un gisement de systèmes inconnus plutôt qu’un coin exotique de la virologie.

Que la sous-annotation soit massive n’est pas une intuition d’informaticien, et Systematic discovery of bacterial anti-phage systems through a protein domain-centric strategy la chiffre sur 4 243 génomes d’Escherichia coli : 39 848 opérons de défense candidats, 2,2 fois ce que voit l’outil standard.

Le socle matériel de l’opération est décrit dans Logan: Planetary-Scale Genome Assembly Surveys Life’s Diversity, qui raconte comment plus de cinquante pétabases de lectures brutes, réparties sur vingt-sept millions de jeux de données, sont devenues 384 téraoctets de contigs assemblés que les agents interrogent nommément dans leurs transcriptions de session.

Le contre-exemple canonique d’une annonce massive passée au crible se lit dans Artificial Intelligence Driving Materials Discovery?, où deux spécialistes examinent un échantillon aléatoire des 2,2 millions de structures annoncées par une équipe de Google et n’y trouvent presque aucun composé à la fois nouveau, crédible et utile.

Le précédent favorable existe aussi, et AI mirrors experimental science to uncover a novel mechanism of gene transfer crucial to bacterial evolution raconte comment une hypothèse produite en quelques jours a retrouvé un mécanisme de détournement de queues de phages établi par des expérimentateurs en plusieurs années.

L’échelle de temps contre laquelle mesurer une annonce faite vingt-quatre heures après la trouvaille figure dans la CRISPR Timeline du Broad Institute, qui égrène deux décennies entre la caractérisation des premiers loci répétés chez des microbes et l’édition du génome démontrée dans des cellules eucaryotes au début de 2013.

Lus ensemble, ces documents déplacent la question. Le gisement est réel et chiffré, et deux équipes viennent d’en tirer le même type d’objet à deux jours d’intervalle. Ce que ni l’une ni l’autre ne fournit encore, c’est la suite : activité enzymatique démontrée, fonction établie, réplication par un tiers, passage devant des relecteurs. Une campagne de calcul et une découverte ne se mesurent pas sur la même horloge.