Jusqu’à présent, il fallait entraîner un robot pour chaque nouvelle tâche. La nouvelle idée est beaucoup plus simple : laissez-le vous regarder pendant quelques secondes
La société de robotique et d’intelligence artificielle Generalist AI a présenté un modèle baptisé GEN-1.5 capable de tenter une nouvelle tâche après avoir observé une seule démonstration d’une durée comprise entre trois et 12 secondes. Ils l’appellent « » : faire avec les robots quelque chose de similaire à ce que nous faisons avec les LLM lorsque nous leur donnons un exemple dans l’invite.
Seulement 10 secondes suffisent. L’idée derrière GEN-1.5, le nouveau modèle robotique de Generalist AI, est d’enseigner quelque chose au modèle robotique au lieu de le « programmer ». Si on lui demande de faire quelque chose de nouveau pour lui, le robot regarde une démonstration physique pendant entre 3 et 12 secondes puis tente de la reproduire. Par exemple, ouvrir une bouteille, ouvrir une fermeture éclair ou sortir un billet d’un portefeuille. Il n’est donc pas nécessaire de créer un nouvel ensemble de données d’entraînement ou d’effectuer des réglages fins ().
Une invite basée sur le mouvement. Un modèle d’IA génératif de texte peut tenter de résoudre une tâche inconnue si nous lui donnons une invite appropriée avec un ou plusieurs exemples montrant comment nous voulons qu’il la résolve. Ici, l’invite n’est pas des mots, mais une vidéo avec les mouvements que nous voulons que le robot apprenne. Le modèle observe l’état initial, la manière dont un objet est manipulé, et cela sert de contexte pour déduire ce qu’il doit faire. Le monde physique devient ainsi l’ensemble des données d’apprentissage.
Il y a des expériences frappantes. L’entreprise a montré comment elle peut concaténer deux démonstrations différentes afin que le robot effectue lui-même les mouvements manquants entre elles. Une démonstration réalisée dans un simulateur peut également être utilisée pour contrôler le robot réel, même si le robot n’a pas été pré-entraîné avec des simulations. En fait, parfois, il n’est même pas nécessaire d’observer un autre robot : si une personne effectue la tâche de ses propres mains devant ses caméras, GEN-1.5 essaie de transférer ces mouvements à ses pinces. Il ne se limite pas à mémoriser une trajectoire exacte, mais tente plutôt d’interpréter quel objectif poursuit cette vidéo de départ.
Prometteur, mais à ses balbutiements. Le généraliste a testé le système avec dix tâches de manipulation simples et relativement courtes, et le taux de réussite de ces tâches était en moyenne de 59 %. Ou ce qui revient au même : il échoue quatre fois sur dix. Dans Wired, ils ont pu voir les robots travailler et ont souligné cette incohérence, ce que les responsables de l’entreprise ont confirmé : les fonctions acquises par le contexte ne sont pas aussi « solides » pour le moment que celles acquises par la formation.
Si vous vous entraînez un peu plus, c’est beaucoup mieux. Le généraliste peut, sur la base de cet apprentissage initial, modifier le modèle, et une formation supplémentaire minimale est alors nécessaire. Avec environ cinq minutes de données (environ 50 démonstrations d’une tâche simple) et seulement 10 mises à jour du modèle, le taux de réussite s’élève à 83 %, tandis que les pondérations du modèle changent de moins de 0,15 %. Pour les experts de Generalist AI, avec ces ajustements, le modèle « se réorganise » et ajuste les connaissances générales qu’il possédait déjà.
Une réalisation prometteuse. DeepMind et Generalist sont deux bons exemples d’entreprises qui tentent de créer des modèles généraux capables de réutiliser ce qu’elles apprennent entre les tâches lors de la manipulation de tous types de scénarios et d’objets. C’est quelque chose de similaire à ce que nous avons déjà vu dans l’IA générative de texte : passer de modèles spécialisés pour chaque problème à un modèle de base large auquel on indique ensuite ce que l’on veut. Chez Generalist, ils prétendent avoir pré-entraîné leurs modèles avec plus d’un demi-million d’heures d’interaction physique, et ils parient qu’une expérience préalable suffisante rendra de plus en plus moins cher l’apprentissage de la prochaine interaction.
Images | IA généraliste
À Simseo | Alors que la Silicon Valley s’occupait d’agents et de code, la Chine s’est emparée d’un domaine crucial de l’IA : vidéo
