GPT-6 Astra repère les erreurs de montage de meubles IKEA
D'après Epoch AI - Furniture Assembly Benchmark (FAB) et The Decoder - compte rendu, relayé par The Decoder
Image : générée (Gemini)
Rédigé à partir de la source originale; chaque fait est vérifié contre le texte source.
À retenir
- Le banc d'essai FAB photographie trois meubles IKEA montés avec des erreurs volontaires; le modèle doit confirmer un montage correct ou nommer les étapes fautives.
- En novembre 2025, le meilleur modèle (Claude Opus 4.5) atteignait 28 %; dix mois plus tard, GPT-6 Astra grimpe à 80 %.
- Claude Fable 5.1 suit à 70 %, Claude Opus 5 à 61 %; les modèles chinois à poids ouverts accusent au moins sept mois de retard.
- GPT-6 Astra met trois minutes par photo : trop lent pour guider un montage en direct, mais utile un jour pour la réparation d'auto ou d'électroménager, selon les chercheurs.
- Le test reste petit : 60 photos, 3 produits, tous construits par la même équipe, avec une note attribuée en partie par un autre modèle. 80 % n'est pas un assistant fiable.
Pourquoi ça compte
Ce n'est pas un outil de bricolage : c'est une mesure du raisonnement visuo-spatial des IA, celui qui relie un schéma technique, un objet réel vu sous un angle et l'ordre des étapes. Le saut de 28 % à 80 % en dix mois illustre la vitesse de ce progrès, sur une tâche où les modèles échouaient récemment à des casse-tête visuels bien plus simples. Mais Epoch AI le dit elle-même : le banc est petit et sa note dépend en partie d'un modèle juge réglé pour être indulgent, à lire comme une frontière qui avance, pas comme une capacité fiable.
Chiffre-clé
80 % de réussite pour GPT-6 Astra à repérer les erreurs de montage, contre 28 % pour le meilleur modèle en novembre 2025 (banc d'essai FAB, Epoch AI, 23 septembre 2026).
Action concrète
La prochaine fois qu'une IA multimodale te dit qu'une photo est « correcte » ou « fautive », souviens-toi que même le meilleur modèle se trompe encore une fois sur cinq sur une tâche cadrée : traite son verdict visuel comme un avis à vérifier, pas comme un constat.
Repères datés
- novembre 2025 - Meilleur score précédent sur le banc FAB : 28 %, par Claude Opus 4.5.
- 23 septembre 2026 - Epoch AI publie le banc d'essai FAB et ses résultats, GPT-6 Astra en tête à 80 %.
Sources originale et média
Sources
- Epoch AI - Furniture Assembly Benchmark (FAB)
- The Decoder - compte rendu
- Relais média : The Decoder → · Lire en français
🔧 Outils mentionnés