Claude Code Opus 5 en mode automatique : un chercheur fait exécuter du code malveillant jusqu'à 80 % du temps
D'après Billet original - Johann Rehberger (wunderwuzzi), Embrace The Red, relayé par Hacker News (frontpage)
Photo : FlyD, Unsplash
Rédigé à partir de la source originale; chaque fait est vérifié contre le texte source.
À retenir
- Publié le 26 août 2026, le piège commence par un site que l'agent explore pour répondre à la demande, menant vers une archive avec un fichier Python du même nom qu'un module standard (struct.py) : ce faux fichier prend la place du vrai et s'exécute à l'import du module base64.
- Sur cinq essais par variante, le taux de réussite a atteint 60 à 80 % - le chercheur précise que sa chaîne d'attaque ne faisait PAS partie des 72 scénarios que l'évaluation commandée par Anthropic (Trajectory Labs) avait testés dix fois chacun, à 0,00 % de réussite.
- Le mode automatique (Auto Mode) - qui remplace les demandes d'approbation humaine par un classificateur de sécurité - est devenu le mode de départ par défaut de Claude Code depuis la mi-août 2026.
- Dans certains essais, une fois l'infection détectée, le mode automatique a lui-même bloqué la commande destinée à arrêter le processus malveillant qu'il avait laissé s'exécuter.
- Anthropic a fermé le signalement du chercheur avec la mention « Informative » : à ses yeux, le mode automatique est une fonction de confort appuyée par un classificateur, pas une garantie de sécurité.
Pourquoi ça compte
Le mode automatique est désormais l'expérience par défaut de Claude Code, l'agent de programmation d'Anthropic : il agit sans demander d'approbation à chaque étape. L'écart entre le 0,00 % annoncé et le 60-80 % démontré importe surtout pour quiconque laisse cet agent lire du contenu web ou des fichiers non fiables avec un accès à des données sensibles - le classificateur se mesure sur un ensemble de scénarios connus, pas contre une attaque inédite.
Chiffre-clé
60 à 80 % : le taux de réussite obtenu par le chercheur sur de petits échantillons (trois à cinq essais par variante), contre 0,00 % rapporté par l'évaluation commandée par Anthropic (72 scénarios x 10 essais, source : embracethered.com, 26 août 2026).
Citation
« we just cannot demonstrate prompt injection anymore. » Boris Cherny, responsable de l'équipe Claude Code chez Anthropic
Action concrète
Si vous utilisez Claude Code (ou un agent de codage similaire) en mode automatique sur du contenu web ou des fichiers non fiables, ne l'exécutez pas sur un poste ayant accès à vos clés SSH, identifiants infonuagiques ou dossiers personnels : lancez-le plutôt dans un conteneur ou une machine virtuelle isolée, avec un accès réseau restreint.
Repères datés
- 30 août 2026 - laveille.ai rapportait déjà une faille où Claude Code exécutait un maliciel caché dans un dépôt GitHub, sans vérification.
Fondée sur la source originale
Sources
- Billet original - Johann Rehberger (wunderwuzzi), Embrace The Red : Chercheur en sécurité indépendant, auteur du blogue de recherche Embrace The Red
- Relais média : Hacker News (frontpage) → · Lire en français
🔧 Outils mentionnés