APEX-Agents
Aussi appelé : ApexBench · APEX Agents · AI Productivity Index for Agents
Mis à jour le
En bref
APEX-Agents est un banc d'essai de Mercor qui mesure si un agent d'IA réussit entièrement des tâches professionnelles longues de finance, de conseil et de droit, sans accès au web.
📖 Définition
Chaque tâche se déroule dans l'un des 33 « mondes » de travail simulés, qui contiennent en moyenne 166 fichiers : courriels, clavardage, calendrier, documents, PDF, tableurs, présentations, système de fichiers et exécution de code. La recherche sur le web y est volontairement coupée, pour que deux exécutions restent comparables.
La mesure principale, appelée Pass@1, est la probabilité qu'un agent réussisse ENTIÈREMENT une tâche du premier coup. Chaque tâche porte une grille de critères tous indispensables : un seul critère manqué et la tâche est un échec, une réussite partielle ne compte pour rien. C'est ce qui explique des scores très bas comparés aux autres bancs d'essai.
💬 En termes simples
Un examen pratique de fin de stage : le dossier est livré complet, ou il ne passe pas.
🎯 Exemple concret
Dans ses notes de version du 21 août 2026, DeepSeek annonce un score de 36,5 à ApexBench (Pass@1) pour son modèle expérimental V4-Flash-Vision-Exp.
💡 Le saviez-vous ?
Les experts estimaient chaque tâche à 1,82 heure. L'échantillon réellement exécuté en a pris 1,37 : on surestime la durée de son propre métier.
❓ Questions fréquentes
Pourquoi voit-on « ApexBench » alors que le nom officiel est « APEX-Agents » ?
Un agent qui réussit une tâche à moitié obtient-il des points ?
Qui corrige les réponses des agents ?
📚 Sources
- APEX-Agents (article de recherche, arXiv 2601.14242, version 3) (Mercor, 2026)
- Introducing APEX-Agents (billet officiel) (Mercor, 2026)
🔗 Termes liés
🏷️ Catégorie parente