L’examen du permis de conduire repose sur trois règles que personne ne conteste. L’itinéraire appartient à l’inspecteur, pour que rien n’ait pu être répété d’avance. Une seule faute éliminatoire suffit à l’échec, quelle que soit la qualité du reste de la conduite. Enfin, celui qui note n’est pas celui qui a formé. Ces principes n’ont rien de propre à l’automobile : ils disent ce qu’il faut réunir pour croire qu’une compétence tiendra hors du lieu où elle s’est acquise.
La robotique domestique a longtemps passé ses examens sur son propre terrain, jusqu’à la démonstration phare du précédent Helix, tenue en janvier dans une cuisine connue du robot. Le 17 septembre 2026, Figure, jeune pousse californienne, a dévoilé Helix 2.5 en envoyant son humanoïde Figure 03 dans trente logements de la région de San Francisco où il n’avait jamais pénétré, face à trois corvées ordinaires et à un barème sans crédit partiel. Il a réussi 56 % des essais, dans une épreuve qui respecte deux des trois règles du permis.
L’enjeu déborde la technique : Figure a levé en septembre 2025 plus d’un milliard de dollars, sur une valorisation de 39 milliards, avec l’objectif affiché d’installer ses robots dans les foyers. Le protocole, le sens du chiffre pour une maison, le rôle de la vidéo humaine, les silences de l’annonce, l’exigence de fiabilité et la distance qui reste jusqu’au produit structurent ce qui suit.
Un examen passé dans trente appartements inconnus
Un modèle figé face à des lieux jamais visités
Helix 2.5 gouverne l’ensemble du comportement de Figure 03 : il interprète ce que le robot perçoit, en déduit la tâche à accomplir et règle chacun de ses mouvements. Aucun des trente appartements loués pour l’éprouver n’avait été cartographié au préalable, et aucune donnée n’y avait été recueillie, selon l’entreprise. Les jouets, serviettes et parures de lit de l’évaluation, mis de côté avant toute expérience, ne figuraient dans aucune donnée décrivant les tâches, et le robot composait avec le mobilier de chaque logement.
Pour chaque tâche, un seul point de contrôle figé a servi dans les trente logements, sans qu’aucun poids soit ajusté aux lieux ni aux objets : le terme zero-shot vaut pour les décors et les objets, les trois corvées ayant été apprises ailleurs. Brett Adcock, qui a fondé l’entreprise et la dirige, résume l’ambition : « Helix 2.5 a été conçu pour répondre à une question plus complexe : un robot humanoïde peut-il entrer dans une maison qu’il n’a jamais vue et se mettre immédiatement au travail, en utilisant tout son corps, de manière autonome ? »
Trois corvées, un chronomètre et aucun crédit partiel
Rien d’une compétition de tri de colis : il s’agit de ranger une pièce, de plier des serviettes, puis de faire un lit, selon des critères fixés d’avance. Le rangement impose de remettre dans un panier les treize à quinze jouets éparpillés, en une minute au plus par jouet ; le pliage, de plier puis d’y déposer les quatre serviettes, trois minutes chacune ; le lit, de placer les deux oreillers et les coins de la couette en tête de lit puis de la lisser, une minute par oreiller ou par côté.
Un pliage raté ou un lit bâclé coûtait un point au robot, car un essai ne compte que si la tâche est entièrement achevée. Ce tout ou rien, qui mesure l’autonomie complète plutôt que l’utilité perçue, est sévère : une serviette bien pliée qui manque le panier est notée comme ratée et fait échouer l’essai. Les correcteurs notaient pourtant jouets rangés, tentatives par objet et qualité de chaque pliage, relevés que Figure ne publie pas et qui seuls distingueraient quasi-réussites et ratés francs.
Ce que 56 % veut dire dans une maison
Trois taux sous une moyenne
Sur les trente logements, le robot a réussi 237 essais sur 420, soit 56 %, un résultat mitigé qui signale pourtant une avancée réelle. La moyenne recouvre 67 % pour le lit (94 sur 140), 62 % pour les serviettes (87 sur 140) et 40 % pour les jouets (56 sur 140) : la tâche la moins technique en apparence est la plus mal réussie, sans doute parce qu’elle enchaîne le plus d’objets. Si chaque jouet est une épreuve indépendante, 40 % pour quatorze jouets impliquent environ 94 % de réussite par objet ; il en faudrait 99,3 % pour aboutir neuf fois sur dix.
Une matinée sur six
Un foyer n’attend pas des tâches isolées mais une routine. Enchaîner les trois corvées revient à multiplier 0,67 par 0,62 puis par 0,40 : à supposer les échecs indépendants, la probabilité de venir à bout du salon, du linge et du lit sans aide tombe autour de 17 %, à peu près une matinée sur six. Les autres jours, quelqu’un ramassera le jouet oublié ou tirera un coin de couette. Le 56 % décrit une moyenne d’épreuves ; la vie domestique en éprouve le produit.
La vidéo humaine, vrai résultat de l’expérience
Le résultat le plus solide tient dans une expérience témoin : entraînée sur les mêmes données de tâche mais sans préentraînement sur Index, la même architecture ne réussit que 9 % des essais contre 56 %, un facteur supérieur à six attribué à la vidéo humaine. Helix 2.5 égale aussi le taux d’une politique Helix 02 entraînée sur le lieu même de son évaluation, avec deux fois moins de données de tâche, aucune tâche ne pesant plus de 1,90 % du préentraînement. En février 2025, le premier Helix reposait encore sur quelque 500 heures de téléopération et ne commandait que le haut du corps.
Index, des gestes filmés à l’échelle industrielle
Présenté le 25 août 2026, Index recueille les vidéos de contributeurs baptisés Creators, qui répètent inlassablement tâches ménagères et gestes de métier chez eux, dans des commerces ou au travail, caméra calée à hauteur de front ; la vidéo de démonstration en montre des extraits vers sa quatrième minute. Helix 2.5 y puise de quoi imiter ces gestes humains. Au lancement, l’application revendiquait des utilisateurs dans 108 pays, dont plus de 44 000 actifs chaque semaine, et 30 minutes de vidéo par seconde, 4,9 années de travail humain par jour ; l’annonce du 17 septembre évoque 35 minutes.
Ego4D, référence académique de la vidéo égocentrée publiée en 2021, réunissait 3 670 heures filmées par 931 porteurs de caméra dans neuf pays : au rythme revendiqué, Index en accumule l’équivalent en deux heures environ. Filtré, dédoublonné et légendé en cinq étapes, ce flux a un prix, 15 millions de dollars déjà versés aux contributeurs et plus d’un milliard promis sur douze mois pour les données et le calcul. Il pose aussi la question du consentement des proches qui traversent le champ d’une caméra domestique.
Franchir l’écart d’incarnation
Reste l’écart d’incarnation : une main humaine n’a ni les proportions, ni les articulations, ni les capteurs d’une main robotique, et un geste filmé ne se rejoue pas tel quel. EgoMimic, de Georgia Tech, concluait fin octobre 2024 qu’une heure de plus de vidéo de mains humaines valait nettement davantage qu’une heure de plus de données robot ; Humanoid Policy ~ Human Policy proposait en mars 2025 un espace d’états et d’actions commun aux deux corps, reciblé vers les commandes du robot. Le passage de 9 % à 56 % porte ces résultats à l’échelle industrielle.
Ce que l’annonce laisse dans l’ombre
L’évaluation, dite en aveugle, a été conçue, conduite et notée par Figure, sans validation indépendante. Son barème compte comme échec toute intervention humaine requise pour la sécurité, mais l’annonce ne dit rien d’une assistance à distance, ne donne aucune durée d’exécution et ne détaille pas les modes d’échec. La question n’a rien de théorique : 1X, qui a ouvert en octobre 2025 les précommandes de NEO, assume un « expert mode » où un employé téléopère le robot. Figure se garde de tout triomphalisme : « The point is not that general humanoid robotics is solved. »
Une loi d’échelle qui ne mesure pas encore la réussite
Le pari s’adosse à une loi d’échelle : sur quatre entraînements couvrant des données multipliées par huit, la perte de prédiction de l’action suivante décroît si régulièrement que les plus petits ont permis d’anticiper le plus gros, avec une erreur de 0,54 % de la variation observée. Cette perte mesure une prédiction, non la réussite au domicile : rien n’établit encore que celle-ci progresse au rythme d’Index, relation dont dépendent les 3,5 milliards de dollars de calcul engagés pour Helix.
La fiabilité, l’autre moitié de l’examen
L’objection de Sunday Robotics
La critique la plus directe est venue de Tony Zhao, PDG de Sunday Robotics, qui a décrit un robot échouant la moitié du temps et posé son équation, « Doing useful work = generalization + reliability » : généraliser ne suffit pas sans fiabilité. Sa société, valorisée 1,15 milliard de dollars, entraîne son robot à roues Memo grâce à un gant porté dans plus de 500 foyers, et revendiquait le 17 juillet 99,1 % de réussite pour son modèle ACT-2, 778 pliages sur 785, en environnements inconnus.
Les deux chiffres ne se comparent pas : Sunday compte chaque vêtement, Figure chaque essai complet, soit quatre serviettes d’affilée pour le pliage. Ramené à la pièce, à supposer les échecs indépendants, le 62 % des serviettes équivaut à environ 89 % par serviette, face aux 99,1 % de Sunday sur d’autres vêtements et selon un autre barème. La querelle porte moins sur les robots que sur l’unité de compte : aucun taux ne vaut sans la règle qui le produit.
Les autres repères publiés
En avril 2025, Physical Intelligence faisait nettoyer des cuisines et des chambres jamais vues à un robot à roues piloté par π0.5, et montrait qu’avec une centaine d’environnements d’entraînement, la performance approchait celle d’un modèle entraîné sur place, selon d’autres métriques. Fin juillet, Gemini Robotics 2 affichait 68,4 % pour une saisie sur table et 45,7 % au sol sur l’humanoïde Apollo 2, et 32 % pour la pelle à poussière avec une main à cinq doigts, sur des gestes brefs et sans protocole public en lieu inconnu.
L’étalon de l’usine
À l’usine BMW de Spartanburg, l’entreprise visait pour son Figure 02 plus de 99 % de cycles réussis et aucune intervention humaine par équipe, chaque pièce placée à 5 millimètres près en 2 secondes dans un cycle de 84 secondes ; le bilan dépasse 1 250 heures, 90 000 pièces et une contribution à 30 000 BMW X3. Entre l’exigence de 99 % d’un poste figé et les 56 % obtenus dans un logement inconnu se mesure le chemin qui reste.
Du logement d’essai au foyer, la distance qui reste
Figure admet qu’aucun de ses robots n’est mûr pour un foyer, mais voit dans Helix 2.5 « les premiers signes d’une intelligence physique plus générale », celle d’une IA qui saisirait le monde physique et y interviendrait seule par l’intermédiaire d’un robot. Présenté en octobre 2025, Figure 03 a été dessiné pour ce décor, avec des capteurs tactiles sensibles à 3 grammes, une recharge inductive par les pieds et des textiles lavables.
Le verrou de la robotique tient là : devant un décor ou un objet jamais rencontré, une friteuse par exemple, la machine doit s’en sortir seule. Quelques robots signent des exploits, quand la plupart échouent encore à lacer une chaussure. Le robot qui fait le lit se fera donc attendre, même si son arrivée paraît inéluctable : Tesla presse le développement d’Optimus, à la mise au point laborieuse, et la Chine compte vendre des humanoïdes bon marché, à l’image d’Unitree. Liquidée en juin 2025, emportant 106 emplois, Aldebaran, créatrice de Nao et de Pepper, rappelle qu’un humanoïde peut séduire sans trouver son marché.
L’épreuve des trente appartements déplace la question : il ne s’agit plus de savoir si un humanoïde peut accomplir une corvée dans un décor préparé, mais combien de fois il l’achève en terrain inconnu, sans aide, selon une règle écrite d’avance. La réponse, 56 %, se contracte à une matinée sur six dès que les tâches s’enchaînent. L’enseignement le plus solide est ailleurs : à données de tâche égales, la vidéo de gestes humains multiplie les réussites par plus de six.
Deux des trois règles du permis sont réunies, l’itinéraire inconnu et la faute éliminatoire. Manque l’examinateur extérieur, et avec lui les modes d’échec, la vitesse, la preuve qu’aucun opérateur n’assistait le robot. Il pourrait venir du droit, en Europe du moins : applicable au 20 janvier 2027, le règlement sur les machines doit soumettre à une évaluation par un tiers les systèmes auto-évolutifs chargés de fonctions de sécurité. Reste l’inconnue du pari de Figure : la réussite grandira-t-elle avec Index aussi régulièrement que décroît la perte de prédiction ?
Au-delà d’une entreprise se dessine une économie où des dizaines de milliers de personnes sont payées pour filmer leurs gestes ménagers au bénéfice de machines destinées à les accomplir, et où la valeur d’un robot se mesurera à sa fiabilité plus qu’à ses démonstrations. C’est au domicile que ces machines devront faire leurs preuves ; nul ne sait encore quand elles y achèveront leur travail neuf fois sur dix.
Aller plus loin
La démarche se lit d’abord dans le texte de l’entreprise, Helix 2.5: Zero-Shot 30-Home Generalization, qui détaille les rubriques de notation tâche par tâche, l’expérience témoin sans préentraînement et la loi d’échelle, et assume, vidéos à l’appui, le caractère préliminaire de l’exercice.
Une lecture critique détaillée se trouve dans Figure’s Helix 2.5 Takes on Chores in 30 Unseen Homes, où Humanoids Daily ventile les résultats par tâche, relève un écart entre 9 % et 8,3 % dans les chiffres publiés du modèle témoin, rapporte l’objection de Tony Zhao et oppose le décompte par vêtement de Sunday à celui par essai de Figure.
La matière première du modèle est décrite dans Introducing Index: Building The World’s Largest and Most Diverse Physical Dataset, qui chiffre le volume de vidéo reçu chaque seconde, la diversité des tâches, des objets et des lieux filmés, les sommes versées aux contributeurs et les cinq étapes de traitement, dessinant les contours d’un micro-travail d’un genre nouveau.
Le changement d’échelle se mesure grâce à Ego4D: Around the World in 3,000 Hours of Egocentric Video, corpus académique de 2021 réunissant plus de neuf cents porteurs de caméra dans neuf pays, dont le volume tient désormais en quelques heures de collecte commerciale, signe du basculement de la vidéo égocentrée de la recherche publique vers l’industrie.
L’intuition qui fonde la stratégie de Figure est éprouvée dans EgoMimic: Scaling Imitation Learning via Egocentric Video, où des chercheurs de Georgia Tech montrent, lunettes Project Aria à l’appui, qu’une heure de vidéo de mains humaines peut rapporter bien davantage qu’une heure de données robot pour apprendre un geste.
Le mécanisme du transfert est exposé dans Humanoid Policy ~ Human Policy, qui construit un espace d’états et d’actions commun à l’humain et à l’humanoïde puis le recible vers les commandes du robot, la manière la plus concrète de comprendre comment se réduit l’écart d’incarnation entre deux corps que tout sépare.
Le précédent le plus proche est documenté dans π0.5: a Vision-Language-Action Model with Open-World Generalization, présenté par ses auteurs comme la première démonstration de tâches ménagères longues dans des maisons inconnues, et qui mesure combien d’environnements d’entraînement il faut à un robot à roues pour égaler un modèle entraîné sur place.
La génération précédente, référence explicite de l’annonce, est présentée dans Introducing Helix 02: Full-Body Autonomy, qui décrit l’architecture en trois étages, de l’équilibre cadencé à un kilohertz jusqu’au raisonnement, et la démonstration du lave-vaisselle, quatre minutes d’autonomie dans une cuisine complète.
L’étalon face auquel lire le 56 % est fourni par F.02 Contributed to the Production of 30,000 Cars at BMW, bilan chiffré d’un déploiement industriel où l’objectif fixait plus de 99 % de cycles réussis et zéro intervention par équipe, et où l’avant-bras s’est révélé le maillon faible du robot, preuve que la fiabilité se joue aussi dans la mécanique.
Le cadre qui attend ces machines en Europe est résumé par l’agence européenne EU-OSHA dans sa fiche Regulation 2023/1230/EU - machinery, consacrée au texte appelé à remplacer la directive de 2006 le 20 janvier 2027 pour mieux couvrir les robots mobiles autonomes et les modules d’IA apprenants chargés de fonctions de sécurité.
De l’article de laboratoire au bilan d’usine, ces sources racontent un domaine qui a changé d’épreuve plus que de niveau. La recherche avait établi que le geste humain filmé pouvait instruire un robot ; l’industrie en tire une collecte mondiale et un protocole en logement inconnu ; l’usine rappelle ce qu’exige un service. Entre une généralisation qui commence à se mesurer et la fiabilité qu’attend un foyer, l’écart ne se refermera qu’avec des mesures publiées, comparables et vérifiées par d’autres que ceux qui les produisent.
