Veille IA Veille IA sans buzz : pour stratèges québécois.
La veille

ImgEdit-Bench

ImgEdit-Bench

ImgEdit-Bench

Aussi appelé : ImgEdit Bench · ImgEdit

Terme IA Intermédiaire 🤖 Intelligence artificielle

Mis à jour le

En bref

ImgEdit-Bench est un banc d'essai qui mesure si un modèle modifie correctement une image existante à partir d'une consigne écrite, en notant d'abord le respect de cette consigne.

📖 Définition

ImgEdit-Bench est un banc d'essai qui évalue les modèles capables de MODIFIER une image existante à partir d'une consigne écrite, et non d'en créer une de zéro. C'est la partie évaluation du projet ImgEdit, mené par une équipe de la Peking University Shenzhen Graduate School, du Peng Cheng Laboratory et de Rabbitpre AI.

Les épreuves vont du simple au retors. La suite de base (734 cas) couvre neuf gestes courants : ajouter ou retirer un objet, changer une couleur ou une matière, remplacer un élément, changer le style, l'arrière-plan ou l'action d'un sujet, combiner plusieurs modifications, ou détourer un sujet sur fond propre. Une deuxième suite (47 cas) complique délibérément la consigne : plusieurs cibles à la fois, objets partiellement cachés ou camouflés. Une troisième (30 cas de trois tours) vérifie si le modèle se souvient de ce qu'il a déjà fait et sait revenir à une version antérieure.

💬 En termes simples

Un juge de patinage qui vérifie d'abord si la figure demandée a été exécutée, avant seulement de noter l'artistique.

🎯 Exemple concret

Une consigne peut demander de retirer un objet sans abîmer le reste de la photo : le juge note alors séparément le respect de la demande et l'intégrité des zones qui ne devaient pas bouger.

💡 Le saviez-vous ?

Une image techniquement superbe qui n'a pas fait la modification demandée ne peut pas bien noter : les notes de qualité et de préservation sont plafonnées par celle du respect de la consigne.

❓ Questions fréquentes

Combien de cas ce banc d'essai contient-il ?
La question n'a pas de réponse tranchée : l'addition des trois suites (734, 47 et 30) donne 811 cas, alors que le tableau de l'article annonce un total de 779. La publication se contredit sur ce point. Elle compte 14 sous-tâches.
Qui corrige les copies ?
Pour les épreuves à un tour, c'est GPT-4o qui note de 1 à 5 sur trois axes : respect de l'instruction, qualité de l'édition, préservation des zones qui ne devaient pas changer. Les épreuves à plusieurs tours, elles, sont évaluées par des humains, par oui ou par non.
Qu'est-ce qu'ImgEdit-Judge ?
C'est un juge ouvert publié par la même équipe : un modèle Qwen2.5-VL-7B affiné sur 200 000 évaluations, pour éviter de dépendre d'un modèle commercial. Les auteurs rapportent environ 70 % d'accord avec les annotateurs humains, à une tolérance d'un point.

📚 Sources

🔐 Connexion rapide

Entrez votre courriel pour recevoir un code à 6 chiffres.

Pas besoin de mot de passe ni d'inscription. Entrez votre courriel, recevez un code par courriel, et c'est tout !