Un agent IA de Claude Code a supprimé 48 000 fichiers en un peu plus de 100 secondes malgré une consigne contraire. L’incident relance une question sensible autour des agents IA : jusqu’où une simple validation humaine peut-elle réellement sécuriser leurs actions ?
🔥 Nous recommandons Bitdefender
Après avoir analysé et testé de nombreuses solutions, Bitdefender s’impose comme le choix numéro 1 grâce à sa défense proactive, sa discrétion et son absence d'impact sur les performances. Il protège efficacement vos appareils contre les virus, ransomwares et liens suspects tout en préservant l'autonomie et la rapidité de votre machine.
Sécuriser mes appareils avec BitdefenderUn agent capable d’agir sur un système informatique peut provoquer des dégâts avant même qu’un humain ait le temps de réagir. L’incident récent qui a impliqué Claude Code en donne une illustration spectaculaire. Guillaume Moigneu, Field CTO chez Upsun, ancienne Platform.sh, livre son analyse sur cet épisode. Pour lui, le principe de « l’humain dans la boucle » doit surtout devenir beaucoup plus précis.
La supervision humaine montre ses limites
L’idée paraît rassurante sur le papier. Un humain valide certaines étapes, tandis que l’agent IA exécute les tâches qui lui sont confiées. Guillaume Moigneu estime toutefois que ce modèle reste trop sommaire face aux capacités actuelles des agents. Toutes les actions ne présentent pas le même risque. Corriger une faute de frappe n’a rien de comparable avec la suppression de plusieurs milliers de fichiers.
Pourtant, une supervision fondée sur quelques points de validation peut traiter ces opérations de façon trop similaire. Le spécialiste défend donc une surveillance proportionnée aux conséquences possibles. Certaines opérations peuvent rester autonomes. D’autres réclament des garde-fous nettement plus stricts, surtout si une erreur devient difficile à réparer.
Un prompt ne constitue pas une barrière
L’incident de Claude Code révèle une autre faiblesse. Selon Guillaume Moigneu, l’agent avait reçu l’instruction de ne pas modifier les fichiers de travail d’origine. Cette consigne n’a pourtant pas suffi à empêcher leur suppression. Un prompt reste une instruction adressée au modèle. Il ne constitue pas une protection technique comparable à une restriction d’accès ou à une permission système.
L’expert estime ainsi qu’une action absolument interdite devrait être rendue techniquement impossible. Une seconde option consiste à garantir sa réversibilité. Sauvegardes, environnements isolés ou restrictions adaptées peuvent alors réduire les dégâts provoqués par une mauvaise décision de l’agent. La sécurité repose donc aussi sur l’infrastructure qui encadre son travail.
Les agents IA ont besoin de limites
Pour Guillaume Moigneu, l’enjeu consiste à identifier les opérations qui nécessitent réellement un jugement humain. Plus une action peut produire des conséquences importantes, plus les mécanismes de contrôle doivent intervenir tôt. Cette réflexion ne signifie pas qu’il faudrait bloquer systématiquement l’autonomie des agents IA.
Le Field CTO d’Upsun défend plutôt une autonomie progressive, accordée selon les capacités démontrées par les systèmes. Les actions sensibles resteraient alors enfermées derrière des limites techniques strictes. L’incident des 48 000 fichiers rappelle ainsi une distinction essentielle : demander à un agent de ne pas exécuter une opération dangereuse ne garantit pas qu’il s’en abstiendra. Une infrastructure bien conçue doit aussi l’empêcher de franchir certaines limites.
Article basé sur un communiqué de presse reçu par la rédaction.