Le fait qu’un robot exécute la tâche n’est plus le seul critère du test

Un robot humanoïde peut apprendre une tâche et l’exécuter avec succès, tout en restant inadapté au travail industriel. Des démonstrations réalisées dans les laboratoires de Cambridge Consultants, au Cambridge Science Park de Cambridge, en Angleterre, ont montré où se situe désormais cet écart : l’utilité commerciale dépend de la capacité du robot à fonctionner rapidement, de manière fiable et en toute sécurité au contact de personnes dont le comportement ne peut pas être entièrement prédit. La capacité à exécuter la tâche reste importante, mais l’aptitude au déploiement met à l’épreuve une part bien plus large du système.

Ce test plus large était visible lorsque Cambridge Consultants, la branche deep-tech du cabinet français de conseil en informatique Capgemini, a ouvert cette semaine ses laboratoires aux médias. Les démonstrations de lundi comprenaient deux robots humanoïdes modifiés avec le matériel et les logiciels propres à Cambridge Consultants. Ces modifications ont mis en évidence le prochain défi d’ingénierie pour l’IA physique : des modèles performants doivent fonctionner via du matériel, des capacités de calcul et des systèmes de sécurité conçus pour les conditions dans lesquelles les robots travailleront.

Ces conditions relèvent le niveau d’exigence, car une démonstration peut montrer qu’un robot a appris une action sans prouver que l’ensemble du système peut la répéter à une vitesse utile au contact de personnes. Le déploiement industriel exige aussi fiabilité et sécurité. Le travail de Cambridge Consultants présente une stack d’IA physique dans laquelle intelligence du modèle, interaction humaine, calcul en temps réel, apprentissage et vérification fonctionnent ensemble.

Les démonstrations montrent pourquoi l’intelligence va au-delà du mouvement

Les deux humanoïdes modifiés rendent concrète cette stack plus large. Cambridge Consultants a équipé l’un des robots d’une nouvelle tête et d’un sac à dos contenant des ressources de calcul supplémentaires, de la connectivité et un coupe-circuit de sécurité. L’entreprise a repensé les mains de l’autre robot pour améliorer sa capacité à saisir et déposer des boîtes dans des usages en usine et en entrepôt. Un meilleur raisonnement a une valeur pratique limitée si la machine ne peut pas exécuter efficacement l’action qui en résulte ou être arrêtée en toute sécurité lorsque nécessaire.

Ces modifications physiques ont été associées à une plateforme robotique de perception, non nommée, fondée sur des foundation models de Nvidia et de Physical Intelligence, une entreprise soutenue par Jeff Bezos et OpenAI. Les foundation models sont des modèles d’IA entraînés de manière suffisamment large pour prendre en charge de nombreuses entrées ou tâches, plutôt qu’un comportement unique programmé de façon étroite. Ici, ils aident un robot à comprendre les personnes et l’environnement qui donnent son contexte à une action.

Cette perception change la manière dont un opérateur peut donner des instructions au robot. La reconnaissance des gestes permet à une personne de désigner l’objet qu’elle veut voir déplacer par le robot, tandis que la parole permet une instruction telle que « déplace ceci ici ». Comme ni « ceci » ni « ici » n’identifient à eux seuls un objet ou une destination, le système doit relier ces mots à ce que fait la personne et à ce qui l’entoure.

Pour Tim Ensor, responsable IA chez Cambridge Consultants, la combinaison de ces signaux rend l’interaction utile. « Associer la parole, le geste, la posture, la compréhension spatiale et la reconnaissance d’objets permet une interaction beaucoup plus proche de celle des humains entre un humain et un robot », a déclaré Ensor à TechTarget AI and Emerging Tech. « Vous pouvez faire référence à des objets dans la pièce en pointant du doigt et au moyen de références ambiguës. » Le robot doit déduire l’intention humaine à partir de plusieurs signaux lorsqu’une commande laisse implicites certaines parties de l’action.

Résoudre cette intention fait partie d’une compréhension utile, car l’aptitude mécanique n’indique pas au robot quel objet une personne désigne. Un robot peut disposer de la politique apprise et de la capacité physique nécessaires pour déplacer une boîte donnée, alors même que l’instruction dépend encore de l’identification de la bonne boîte, de sa destination et de la manière dont le geste de la personne modifie le sens de ses mots. L’interaction humaine transforme donc la perception et le contexte en entrées pour les décisions du robot.

Experts Okoone
PARLONS-EN !

Un projet en tête ?
Planifiez un appel de 30 minutes avec nous.

Des experts senior pour vous aider à avancer plus vite : produit, tech, cloud & IA.

Veuillez saisir une adresse email professionnelle valide.

Les usines sont structurées ; les humains qui s’y trouvent ne le sont pas

La nécessité d’interpréter les personnes devient plus difficile à éviter lorsque les robots quittent les démonstrations contrôlées. Les usines offrent un environnement relativement structuré pour les premiers déploiements, surtout par rapport aux environnements domestiques, car les équipements et les workflows peuvent être organisés autour d’opérations définies. Les travailleurs continuent néanmoins d’agir d’une manière dont le robot ne peut pas supposer qu’elle suivra une seule séquence prédéfinie.

Cette incertitude limite l’utilité pratique. Ensor a déclaré : « L’utilité de votre robot est limitée s’il ne peut pas interagir avec des humains imprévisibles. » L’interaction humaine devient donc une exigence opérationnelle : un robot qui ne fonctionne correctement que lorsque les personnes se comportent exactement comme sa démonstration le prévoit dispose d’un éventail plus restreint de conditions réellement utiles.

La même exigence apparaît plus tôt, lorsqu’un robot polyvalent apprend quel travail effectuer. Une machine censée prendre en charge plusieurs tâches doit acquérir de nouvelles tâches au lieu de rester liée à un workflow fixe ; les personnes ont donc besoin d’un moyen efficace de fournir des instructions et une formation. « Pour amener un robot à un niveau polyvalent, quelqu’un doit lui montrer comment effectuer ces tâches », a déclaré Ensor.

L’enseignement compte aussi après qu’un robot est capable d’exécuter un workflow sans supervision constante. Comme l’a formulé Ensor, « Même s’il n’a pas besoin d’interagir constamment avec des humains pendant un workflow, il doit tout de même exister un moyen pour que ces robots interagissent efficacement avec les humains. » Le problème d’ingénierie couvre deux formes d’interaction : les personnes communiquent leur intention pendant l’exploitation, et elles aident les robots à acquérir ou à améliorer des comportements qui ne peuvent pas tous être fixés à l’avance.

Ces formes d’interaction modifient la manière dont l’aptitude au déploiement doit être évaluée. Un test contrôlé peut éliminer l’ambiguïté des instructions, des objets environnants et du comportement des personnes, alors que les systèmes industriels doivent gérer cette ambiguïté lorsqu’elle se présente. La parole, le geste, la posture et la compréhension spatiale deviennent donc des éléments de l’architecture de déploiement dès lors que les robots doivent travailler avec des personnes.

L’apprentissage lance un processus de déploiement plus large

La nécessité d’acquérir de nouveaux comportements rend également importante la technologie de modèle qui sous-tend les robots adaptables. Les modèles vision-language-action, ou modèles VLA, relient ce qu’un robot voit et comprend à partir du langage aux mouvements physiques qu’il exécute. Ils sont devenus une approche de premier plan pour les robots qui doivent s’adapter plutôt qu’exécuter une seule routine prédéterminée.

Cambridge Consultants expérimente des systèmes qui apprennent à partir de la vidéo et combinent ce qu’ils en extraient avec le langage. Lorsqu’un mouvement est décrit verbalement, le robot peut se former une attente de ce à quoi ce mouvement devrait ressembler avant de tenter lui-même l’action. Des exemples vidéo et le langage humain peuvent donc conduire à un comportement physique sans exiger que chaque tâche soit spécifiée comme une séquence fixe de mouvements.

Une fois qu’un robot a appris le mouvement, le déploiement introduit des exigences de performance mesurables. « Vous pouvez faire cela pour un robot, et il sera capable d’exécuter la tâche à une certaine vitesse et avec un certain pourcentage de fiabilité », a déclaré Ensor. La vitesse et la fiabilité comptent pour un opérateur industriel, car elles déterminent si la machine accomplit le travail assez rapidement et avec une constance suffisante pour l’environnement visé.

Ces mesures révèlent un écart dans les systèmes testés par Cambridge Consultants. « Mais nous constatons généralement qu’ils ne sont pas réellement assez rapides ni assez fiables pour passer directement à un déploiement industriel », a poursuivi Ensor. Les systèmes VLA peuvent établir une exécution de tâches adaptable, tandis que l’ingénierie du déploiement doit encore rendre cette exécution suffisamment rapide et fiable pour un usage industriel.

Pour combler cet écart, Cambridge Consultants travaille sur ce qu’Ensor appelle des « composants fonctionnels non centraux ». L’une des exigences consiste à exécuter efficacement de grands modèles sur des plateformes de calcul plus petites, car le robot a besoin de capacités de calcul locales suffisantes pour utiliser son modèle sous des contraintes d’exploitation en temps réel. Les capacités de calcul supplémentaires et la connectivité ajoutées à l’humanoïde présenté montrent comment les exigences des modèles deviennent des décisions d’architecture matérielle lorsque l’IA doit fonctionner à l’intérieur d’une machine physique.

Les performances peuvent aussi s’améliorer par l’expérience après la phase d’apprentissage initiale. Cambridge Consultants développe des boucles d’auto-apprentissage dans lesquelles des tentatives répétées, combinées à une certaine intervention humaine, permettent au robot de progresser. Ces boucles relient le problème initial de formation humaine à l’ingénierie du déploiement, car les personnes peuvent contribuer à l’amélioration pendant que le robot accumule de l’expérience au fil d’exécutions répétées.

L’amélioration des performances doit ensuite être testée en vue d’un usage fiable et sûr. Cambridge Consultants développe des processus de validation et de vérification conçus pour démontrer la fiabilité et la sécurité. La vérification contrôle si un système satisfait à des exigences spécifiées, tandis que la validation établit si son comportement convient à l’usage prévu. Pour un système physique travaillant au contact de personnes, ces deux processus deviennent des éléments du dossier justifiant l’introduction d’un comportement appris en production.

Ces processus s’inscrivent dans l’architecture full-stack plus large que défend Cambridge Consultants. La stack comprend une architecture de calcul capable d’exécuter les modèles assez rapidement pour un usage en temps réel, une couche de connaissance qui donne au robot une compréhension de son environnement, et une couche d’intelligence capable de choisir des actions utiles à partir de ces informations. Chaque couche influe sur le déploiement, car une décision correcte peut malgré tout produire un comportement inutilisable si elle arrive trop lentement, s’appuie sur une connaissance incomplète de l’environnement ou se traduit par une action physique inadaptée.

Le matériel visible à Cambridge montre comment ces couches atteignent la machine physique. Les capacités de calcul et la connectivité ajoutées répondent aux exigences de traitement et de communication, le coupe-circuit fournit un mécanisme de sécurité direct, les mains repensées améliorent l’exécution de tâches telles que le déplacement de boîtes, et la perception multimodale aide à interpréter les personnes et l’environnement. L’apprentissage VLA, les boucles d’auto-apprentissage, la validation et la vérification traitent d’autres aspects du même problème de déploiement. Cambridge Consultants a un intérêt commercial dans cette manière de présenter les choses car, en tant que branche deep-tech de Capgemini, l’entreprise vend son expertise en ingénierie et en conseil aux organisations confrontées à ce type de problèmes technologiques et de déploiement.

Les déploiements à court terme peuvent prouver la valeur pratique

L’écart d’ingénierie qui subsiste conduit néanmoins Ensor à une prévision commerciale à court terme. Il s’attend à des déploiements commerciaux de vrais robots effectuant un « travail utile » « dans l’année qui vient ». Cette attente peut coexister avec les limites actuelles, car un déploiement commercial utile peut fonctionner dans le cadre de tâches et d’environnements particuliers, tandis que l’objectif plus large d’un usage polyvalent reste en cours de développement.

Cette distinction correspond à la caractérisation par Ensor de l’IA physique comme étant à un stade précoce. « C’est un domaine passionnant dont nous ne sommes en réalité qu’au tout début », a-t-il déclaré. Des déploiements à court terme établiraient que certains robots peuvent apporter une valeur pratique dans certaines conditions d’exploitation, tandis que le défi plus large reste de rendre des systèmes de plus en plus généraux rapides, fiables et sûrs au contact de personnes imprévisibles.

L’ambition à plus long terme va au-delà de l’automatisation d’un autre workflow industriel fixe. « La véritable promesse de l’IA physique est une transformation du travail manuel dans des proportions similaires à celles que nous observons pour le travail numérique transformé par l’IA agentique. À partir de maintenant, nous n’allons voir qu’une progression vers cet objectif », a déclaré Ensor. Pour que l’intelligence apprise atteigne cette ambition, elle doit résister à l’exploitation en temps réel, à l’exécution physique répétée, aux instructions humaines et à l’incertitude environnementale, tout en satisfaisant à des exigences de sécurité pouvant être démontrées.

Points clés

  • Évaluez l’ensemble du système : L’aptitude industrielle dépend de la vitesse, de la fiabilité, de la sécurité, des capacités de calcul et d’un matériel efficace, en plus de la performance apprise sur la tâche. Les acheteurs qui évaluent des robots humanoïdes peuvent apprécier ensemble ces facteurs dans des conditions d’exploitation réalistes.
  • Concevez l’interaction en fonction du comportement humain : La parole, le geste, la posture et la perception spatiale aident les robots à interpréter des instructions ambiguës et à travailler au contact de personnes imprévisibles. Les équipes de déploiement peuvent tester ces capacités avec de vrais travailleurs plutôt qu’au travers d’interactions étroitement scénarisées.
  • Intégrez l’interaction humaine au déploiement : Les usines offrent des environnements structurés, mais les travailleurs introduisent toujours de l’incertitude et jouent un rôle dans l’apprentissage de nouvelles tâches. Les opérateurs peuvent évaluer avec quelle facilité les employés donnent des instructions aux robots, les corrigent et travaillent à leurs côtés à mesure que les exigences évoluent.
  • Faites passer les tâches apprises au niveau de la production : Les modèles VLA peuvent enseigner des comportements adaptables, tandis que l’usage industriel exige un travail supplémentaire sur le calcul en temps réel, l’apprentissage répété, la validation et la vérification. Les équipes technologiques peuvent définir des objectifs mesurables en matière de vitesse d’exécution, de fiabilité et de sécurité avant la mise en production.
  • Concentrez les investissements à court terme sur des usages définis : Cambridge Consultants prévoit des déploiements commercialement utiles dans l’année, alors que l’IA physique polyvalente en est encore à ses débuts. Les acheteurs peuvent prioriser des tâches et des environnements délimités dans lesquels les systèmes humanoïdes actuels peuvent démontrer une valeur opérationnelle mesurable.

Alexander Procter

octobre 2, 2026

14 Min

Experts Okoone
PARLONS-EN !

Un projet en tête ?
Planifiez un appel de 30 minutes avec nous.

Des experts senior pour vous aider à avancer plus vite : produit, tech, cloud & IA.

Veuillez saisir une adresse email professionnelle valide.