Gemini Robotics ER 2 : le nouveau modèle de raisonnement incarné de Google
Google vient de dévoiler Gemini Robotics ER 2, son modèle le plus puissant à date pour piloter des robots dans des environnements physiques réels. Ce n’est pas juste une mise à jour de plus : c’est une déclaration de positionnement dans une course qui s’intensifie sérieusement. Le concept de « raisonnement incarné » mérite qu’on s’y attarde. Ça va bien au-delà de comprendre du texte ou d’analyser une image. Ce que tu vas apprendre :
- Ce que Google entend par « raisonnement incarné » et pourquoi ça change la donne pour la robotique
- Ce que ER 2 fait concrètement mieux que son prédécesseur, selon ce qu’on sait à date
- Comment Google se positionne face à Figure, Physical Intelligence et Boston Dynamics
- Les zones d’ombre qui restent : déploiement, partenaires matériels, disponibilité réelle
Ce qui a été annoncé
Google DeepMind présente Gemini Robotics ER 2 comme son modèle de raisonnement incarné le plus capable à ce jour. Le nom complet signifie « Embodied Reasoning 2 », et le mot « embodied » est intentionnel : on parle d’un modèle conçu spécifiquement pour exister dans un corps physique, pas seulement pour traiter de l’information en abstraction. L’annonce positionne ER 2 comme une avancée significative par rapport à la première génération du modèle Gemini Robotics, avec une amélioration notable sur plusieurs axes : la compréhension d’instructions complexes, l’adaptation à des situations imprévues, et la capacité à collaborer avec des humains dans des espaces partagés.
Ce qui distingue cette annonce des habituels communiqués de labo, c’est la mise en avant explicite de scénarios du monde réel. Google DeepMind ne parle pas de benchmarks en chambre propre. L’accent est mis sur des tâches qui combinent perception, décision et action dans des contextes variables.
À la Taverne, on distingue les annonces de labo des annonces de déploiement. ER 2 est encore clairement dans la première catégorie. Mais c’est une annonce de labo qui mérite d’être prise au sérieux.
Le raisonnement incarné : ce que ça veut dire concrètement
La plupart des grands modèles de langage raisonnent à partir de tokens : du texte, des images, parfois de l’audio. Ils produisent des outputs textuels ou génèrent des contenus. C’est puissant, mais ça reste dans le domaine de l’information. Le raisonnement incarné, c’est autre chose. Le modèle reçoit des données sensorimotrices : la position d’un bras, la résistance d’un objet saisi, la trajectoire d’un humain qui s’approche. Il doit intégrer ces signaux en temps réel pour générer des actions physiques cohérentes, pas des mots.
Le défi technique est considérable. Un humain qui attrape un verre sur une table ne « pense » pas à chaque micro-ajustement de ses doigts. Il y a des boucles de rétroaction qui opèrent à des vitesses que le raisonnement conscient ne peut pas suivre. Reproduire quelque chose d’équivalent dans un modèle IA demande une architecture qui gère des latences très différentes de celles d’un chatbot. C’est là que réside la vraie difficulté de la robotique pilotée par grands modèles. Les LLMs sont entraînés pour être réfléchis. Les robots ont besoin d’être rapides et corrects simultanément. ER 2 cherche à réconcilier ces deux impératifs.
Le raisonnement incarné n’est pas une métaphore philosophique. C’est une contrainte d’ingénierie : le modèle doit agir dans le monde physique avec des conséquences irréversibles. Un token mal prédit, ça corrige avec un édit. Un mouvement de bras mal calibré, ça renverse une bouteille, ou pire.
Ce que ER 2 fait mieux que son prédécesseur
Selon les informations disponibles à date, ER 2 représente une amélioration substantielle sur plusieurs dimensions par rapport à la première génération. Compréhension d’instructions complexes. Le modèle peut décomposer des demandes formulées en langage naturel en séquences d’actions physiques. « Prends le bac rouge, mets-le sur la deuxième étagère à gauche en évitant les objets fragiles » : ER 2 comprend la hiérarchie des contraintes dans cette instruction, pas juste le verbe principal. Adaptation aux situations imprévues. C’est l’un des angles les plus mis en avant. Si un objet n’est pas là où le robot l’attend, ou si un humain entre dans l’espace de travail de façon inattendue, ER 2 doit replanner en temps réel. Les approches précédentes nécessitaient souvent une intervention humaine dans ces cas-là.
Collaboration humain-robot. Le modèle est conçu pour fonctionner dans des espaces où des humains sont présents et actifs, pas juste dans des environnements contrôlés sans personnel. Ça inclut la prédiction des intentions humaines, la cession de priorité, et la communication gestuelle ou verbale avec les opérateurs.
| Dimension | Génération précédente | Gemini Robotics ER 2 |
|---|---|---|
| Instructions complexes | Commandes simples et directes | Décomposition de contraintes multiples |
| Adaptation en temps réel | Intervention humaine souvent requise | Replanning autonome |
| Environnement | Espaces contrôlés sans personnel | Espaces partagés humain-robot |
| Collaboration humaine | Limitée, basée sur des règles | Prédiction d'intention intégrée |
| Généralisation | Tâches spécifiques entraînées | Transfert à des tâches nouvelles |
Le transfert vers des tâches nouvelles est particulièrement important. Les modèles de robotique traditionnels nécessitaient des heures de collecte de données spécifiques pour chaque nouvelle tâche. ER 2 vise à généraliser à partir de moins de démonstrations, ce qui réduit drastiquement le coût de déploiement dans de nouveaux contextes.
Collaboration humain-robot et résolution de tâches réelles
La collaboration humain-robot n’est pas qu’un argument marketing. C’est l’un des verrous réels du déploiement industriel. Un robot qui ne peut opérer que dans un espace totalement isolé a des cas d’usage très limités. Un robot qui peut travailler à côté d’humains, en comprenant leurs actions et en adaptant les siennes, ouvre un champ d’applications radicalement plus large. ER 2 intègre ce que Google appelle la conscience situationnelle partagée. Concrètement : le modèle ne modélise pas seulement son propre état et les objets dans l’environnement. Il modélise aussi l’état et les intentions probables des humains présents. C’est une couche de complexité supplémentaire qui n’existait pas dans les approches purement basées sur la vision.
Pour la résolution de tâches du monde réel, Google illustre ER 2 avec des scénarios comme la manipulation d’objets déformables, le tri dans des environnements désorganisés, et l’assemblage de composants qui nécessitent une séquence précise. Ces tâches ont en commun d’être faciles pour un humain de dix ans et historiquement très difficiles pour des systèmes robotiques. Le point qui mérite attention : ER 2 gère mieux l’ambiguïté. Quand une instruction est incomplète ou quand l’environnement ne correspond pas aux attentes, le modèle peut demander une clarification ou choisir l’interprétation la plus probable avec un signal de confiance. C’est beaucoup plus proche du comportement d’un humain compétent que des systèmes qui bloquent ou exécutent n’importe quoi.
Où en est Google dans la course à la robotique IA
Soyons clairs sur le paysage. Google n’est pas seul. Physical Intelligence (pi.ai) a publié des travaux sur la généralisation de politiques robotiques avec des approches basées sur la diffusion. Figure a annoncé des déploiements réels dans des entrepôts avec son propre modèle Vision-Language-Action. Boston Dynamics continue d’avancer sur la locomotion et commence à intégrer de l’IA cognitive à ses robots existants. 1X, Agility Robotics, Apptronik : la liste des acteurs sérieux s’allonge chaque trimestre.
Ce qui distingue Google dans ce paysage, c’est l’accès à une infrastructure de calcul massive, une expertise profonde en grands modèles de langage multimodaux, et une équipe DeepMind avec un historique de recherche fondamentale sérieux. Ce que Google n’a pas encore montré publiquement, c’est un déploiement à grande échelle dans des environnements industriels réels. C’est encore le défi.
| Acteur | Force principale | Ce qui reste à prouver | |||
|---|---|---|---|---|---|
| Google DeepMind (ER 2) | Modèles multimodaux, infrastructure, recherche fondamentale | Déploiement à grande échelle, partenaires matériels | Figure | Déploiements industriels réels, robot humanoïde propriétaire | Généralisation hors cas entraînés |
| Physical Intelligence | Généralisation de politiques, approche diffusion | Échelle et vitesse d'exécution | |||
| Boston Dynamics | Locomotion , durabilité mécanique | Intégration cognitive avancée |
Le modèle de Google est aussi différent des autres : ER 2 est conçu pour être un modèle fondation que des partenaires matériels peuvent intégrer à leurs plateformes. Ce n’est pas un robot Google. C’est un cerveau que des fabricants de robots peuvent embarquer. C’est un pari stratégique différent de Figure ou Boston Dynamics qui contrôlent le hardware.
Google joue la carte du modèle fondation en robotique comme OpenAI a joué la carte du modèle fondation en langage. La question : est-ce que le terrain physique se laisse platformiser de la même façon que le terrain textuel? Réponse dans quelques années.
Ce qu’on ne sait pas encore
C’est la section la plus importante de cet article. Parce que l’annonce de ER 2 laisse ouvertes plusieurs questions qui détermineront si c’est un vrai tournant ou un démo lab impressionnant de plus. Les partenaires matériels. ER 2 est un modèle. Pour qu’il pilote un robot, il faut un robot. Google n’a pas détaillé publiquement quels fabricants de robots intégreront ER 2, à quelle échéance, ni dans quels secteurs industriels prioritaires. Sans une liste de partenaires hardware concrets avec des délais, l’impact réel reste spéculatif. Les latences réelles. La beauté d’une démonstration en labo, c’est qu’elle peut être soigneusement chorégraphiée. Un modèle de raisonnement incarné qui prend trop de temps à inférer entre chaque action n’est pas utilisable en temps réel. Les performances de ER 2 dans des conditions non contrôlées, avec des contraintes de latence strictes, ne sont pas encore documentées publiquement. Le coût d’inférence. Faire tourner un grand modèle en continu pour piloter un robot, ça coûte de la puissance de calcul. Beaucoup. Est-ce que ER 2 peut tourner en périphérie (on-device ou edge computing) ou est-ce que chaque robot nécessite une connexion cloud permanente? La réponse a des implications majeures sur la fiabilité, la confidentialité industrielle, et les coûts opérationnels. La disponibilité pour les développeurs. À date, il n’y a pas d’accès public à ER 2 via une API robotique. Google DeepMind travaille avec des partenaires sélectionnés. Les équipes qui veulent intégrer ER 2 dans leurs systèmes n’ont pas de porte d’entrée claire ni de calendrier annoncé.
Pour ce qui est des tarifs, les plans Gemini grand public (Free à 0 USD/mois, AI Plus à 8 USD/mois, AI Pro à 20 USD/mois, AI Ultra à 255 USD/mois) concernent l’assistant conversationnel et n’ont aucun rapport direct avec l’accès à ER 2. La tarification d’un accès à un modèle de robotique de cette nature serait vraisemblablement un arrangement entreprise ou recherche distinct, dont les modalités n’ont pas été annoncées.
Ce qu’on retient de cette annonce
Gemini Robotics ER 2 est une annonce sérieuse qui mérite d’être prise au sérieux. Pas parce que Google a résolu la robotique généraliste (personne ne l’a fait), mais parce que le cadrage technique de « raisonnement incarné » représente une façon mature de poser le problème. Le vrai test, ce sera l’utilisation dans des environnements non préparés, avec du matériel imparfait, par des opérateurs qui ne sont pas des chercheurs en robotique. Ce test-là, on ne l’a pas encore vu. L’annonce ouvre la question. Elle ne la ferme pas. Ce qu’on peut dire avec confiance : Google DeepMind est dans la course robotique pour de vrai, avec une stratégie de modèle fondation distinct de ses concurrents directs. ER 2 positionne Gemini non plus seulement comme un assistant textuel ou visuel, mais comme le cerveau potentiel d’une nouvelle génération de machines physiques. Si tu travailles dans l’automatisation, la logistique, ou la conception de systèmes robotiques, c’est le moment de surveiller les annonces de partenariats matériels de Google DeepMind. C’est là que l’annonce d’aujourd’hui deviendra (ou ne deviendra pas) une réalité opérationnelle. Pour tout le reste : le Tour de Table de la Taverne continue de suivre les développements en robotique IA chaque semaine. Les annonces s’accélèrent. Le temps de regarder ailleurs est passé.
Sources : Google DeepMind, annonces officielles Gemini Robotics ER 2. Les faits non confirmés dans cet article sont présentés comme tels.
Check tes courriels.
Lien à cliquer pour confirmer ton abonnement.
Texte par David Cyr
