Veille IA Veille IA sans buzz : pour stratèges québécois.
La veille

GPT-6 Astra repère les erreurs de montage de meubles IKEA

2 min de lecture · The Decoder · 26 sept. 2026

D'après Epoch AI - Furniture Assembly Benchmark (FAB) et The Decoder - compte rendu, relayé par The Decoder

GPT-6 Astra repère les erreurs de montage de meubles IKEA

Image : générée (Gemini)

Rédigé à partir de la source originale; chaque fait est vérifié contre le texte source.

À retenir

  • Le banc d'essai FAB photographie trois meubles IKEA montés avec des erreurs volontaires; le modèle doit confirmer un montage correct ou nommer les étapes fautives.
  • En novembre 2025, le meilleur modèle (Claude Opus 4.5) atteignait 28 %; dix mois plus tard, GPT-6 Astra grimpe à 80 %.
  • Claude Fable 5.1 suit à 70 %, Claude Opus 5 à 61 %; les modèles chinois à poids ouverts accusent au moins sept mois de retard.
  • GPT-6 Astra met trois minutes par photo : trop lent pour guider un montage en direct, mais utile un jour pour la réparation d'auto ou d'électroménager, selon les chercheurs.
  • Le test reste petit : 60 photos, 3 produits, tous construits par la même équipe, avec une note attribuée en partie par un autre modèle. 80 % n'est pas un assistant fiable.

Pourquoi ça compte

Ce n'est pas un outil de bricolage : c'est une mesure du raisonnement visuo-spatial des IA, celui qui relie un schéma technique, un objet réel vu sous un angle et l'ordre des étapes. Le saut de 28 % à 80 % en dix mois illustre la vitesse de ce progrès, sur une tâche où les modèles échouaient récemment à des casse-tête visuels bien plus simples. Mais Epoch AI le dit elle-même : le banc est petit et sa note dépend en partie d'un modèle juge réglé pour être indulgent, à lire comme une frontière qui avance, pas comme une capacité fiable.

Chiffre-clé

80 % de réussite pour GPT-6 Astra à repérer les erreurs de montage, contre 28 % pour le meilleur modèle en novembre 2025 (banc d'essai FAB, Epoch AI, 23 septembre 2026).

Action concrète

La prochaine fois qu'une IA multimodale te dit qu'une photo est « correcte » ou « fautive », souviens-toi que même le meilleur modèle se trompe encore une fois sur cinq sur une tâche cadrée : traite son verdict visuel comme un avis à vérifier, pas comme un constat.

Repères datés

  • novembre 2025 - Meilleur score précédent sur le banc FAB : 28 %, par Claude Opus 4.5.
  • 23 septembre 2026 - Epoch AI publie le banc d'essai FAB et ses résultats, GPT-6 Astra en tête à 80 %.

Sources originale et média

Sources

🔧 Outils mentionnés

🔐 Connexion rapide

Entrez votre courriel pour recevoir un code à 6 chiffres.

Pas besoin de mot de passe ni d'inscription. Entrez votre courriel, recevez un code par courriel, et c'est tout !

✓

✓ ✕ ℹ