Nous avons un nouveau « benchmark » pour l'IA : demandez-lui si vous avez correctement assemblé ou non vos meubles Ikea

Nous avons un nouveau « benchmark » pour l’IA : demandez-lui si vous avez correctement assemblé ou non vos meubles Ikea

Nous connaissons Epoch AI pour son ambitieux benchmark mathématique pour l’IA, mais ses responsables ont eu une idée très originale il y a longtemps. Ils ont acheté trois meubles chez IKEA, ont commencé à les assembler et, de temps en temps, ils ont fait exprès quelque chose de mal. Ensuite, ils ont pris des photos et les ont montrées à différents modèles d’IA avec le manuel d’instructions. La mission de l’IA était de décider si le meuble était correctement assemblé et sinon, de trouver où l’erreur avait été trouvée. Nous avons une bonne nouvelle : ils se sont grandement améliorés.

De 28 % à 80 % en seulement dix mois. Les données sont surprenantes, car l’amélioration des modèles dans ce que l’on appelle le Furniture Assembly Benchmark (FAB) est notable. En novembre 2025, le meilleur modèle d’IA de ce test était Claude 4.5, et il a atteint 28 % d’exactitude. En septembre 2026, le GPT-6 Astra a atteint 80 %, et non seulement il était beaucoup plus précis : il lui fallait en moyenne trois minutes par photo, soit entre deux et dix fois moins de temps que les modèles qui figuraient auparavant parmi les meilleurs.

Il ne suffit pas de « regarder » une photo. Les modèles reçoivent une photographie des meubles à moitié assemblés, le manuel officiel IKEA, un outil pour agrandir les zones de l’image et un interpréteur Python. À partir de là, vous devez relier les schémas du manuel avec des pièces réelles photographiées sous certains angles spécifiques. L’objectif : reconstituer les étapes suivies par la personne qui a assemblé le meuble et détecter des choses comme une pièce placée à l’envers. Epoch a même continué les montages après avoir introduit le bug pour que cette erreur ne soit pas forcément la dernière étape visible et rende ainsi la tâche plus difficile pour l’IA.

IKEA n’est qu’une excuse. Ce qu’Epoch AI veut mesurer, c’est la capacité de raisonnement abstrait des modèles d’IA. Autrement dit, s’ils sont capables de connecter des instructions abstraites (des manuels IKEA, dans ce cas) avec des objets du monde réel. C’est une compétence essentielle pour qu’un jour un modèle d’IA puisse nous aider à réparer un appareil ou une voiture suivant une documentation technique. S’il est facile d’évaluer des modèles en mathématiques ou en programmation, ce n’est pas du tout le cas lorsqu’il s’agit d’évaluer la vision ou le raisonnement spatial et leur application à notre monde.

Progression de l’assemblage des meubles au fil du temps

Source : Époque AI.

Mais on est loin des robots qui assemblent nos meubles. Ce FAB analyse si une IA peut observer le travail effectué par une personne et le vérifier, mais pas si elle peut physiquement planifier et exécuter l’ensemble du processus à partir de zéro. Ainsi, on peut reconnaître qu’une pièce est inversée lorsqu’on a le manuel sous les yeux et qu’on a une photo pour étudier la situation. Cependant, cela est très différent d’une machine capable de manipuler des pièces, de résoudre des imprévus et d’assembler avec succès un meuble.

Faux positifs. De plus, Epoch AI a trouvé différents biais selon la famille de modèles utilisée. Gemini et Qwen avaient tendance à supposer qu’il y avait toujours des bugs et à trouver des erreurs qui n’existaient pas. Les modèles précédents d’OpenAI et d’Anthropic souffraient du problème inverse : ils supposaient de bonnes versions contenant des erreurs. Le processus a montré qu’il était aussi important de rechercher les erreurs dans l’assemblage que de savoir quand arrêter de les rechercher.

On a demandé à Sam Altman si la formation d’une IA n’était pas inefficace. Il a répondu que "former" pour un humain, c'est plus

Moravec revient. L’expérience laisse subsister une curiosité déjà observée : on apprend à mesurer de mieux en mieux comment les modèles d’IA résolvent des problèmes avec une solution que l’on peut ensuite vérifier. Le problème est de les mesurer lorsque le processus est plus ambigu. Nous revenons au vieux paradoxe de Moravec : l’intelligence artificielle rend facile ce qui est difficile et vice versa.

À Simseo | Le monde manque de données pour continuer à former l’IA. La Chine a un atout dans sa manche