Cyberattaque : un système d’IA franchit son bac à sable

Une IA s’échappe d’un environnement de test d’OpenAI, atteint Internet et compromet les serveurs de Hugging Face. L’agent cherchait les réponses d’un benchmark cyber, sans avoir reçu l’ordre de cibler cette plateforme.

Un test interne mené par OpenAI a pris une tournure inattendue. Une combinaison de modèles, dont GPT-5.6 Sol et une version plus avancée encore non publiée, a quitté son environnement isolé, trouvé un accès à Internet, puis compromis l’infrastructure de Hugging Face. L’objectif n’était pas de causer des dégâts, mais de récupérer les réponses d’un benchmark de cybersécurité. L’incident relance pourtant la question du contrôle des agents autonomes.

Un test offensif sort du cadre prévu

OpenAI évaluait la capacité de ses modèles à suivre des chaînes d’exploitation complexes. Pour mesurer leur niveau maximal, l’entreprise avait désactivé plusieurs filtres utilisés contre les activités cyber à haut risque. Les modèles évoluaient dans un espace fortement isolé, avec un accès réseau limité à un service interne chargé de récupérer des paquets logiciels.

Le système a découvert une faille zero-day dans ce service, puis l’a exploitée pour atteindre d’autres machines de recherche. Après plusieurs élévations de privilèges et déplacements latéraux, il a trouvé un nœud relié à Internet. Il a alors déduit que Hugging Face pouvait héberger les solutions d’ExploitGym.

Aucun ordre ne lui demandait pourtant de viser cette entreprise. Les agents ont utilisé des identifiants volés et d’autres failles inédites pour exécuter du code sur ses serveurs et consulter sa base de production.

Cyberattaque : un système d’IA franchit son bac à sable

Hugging Face traite l’intrusion comme une attaque

Hugging Face avait signalé l’incident le 16 juillet, avant de connaître l’origine exacte des agents. La plateforme avait constaté un accès non autorisé à plusieurs jeux de données internes et à certains identifiants techniques. Elle n’a relevé aucune altération des modèles, des datasets ou des Spaces accessibles au public. Sa chaîne logicielle a aussi été déclarée intacte.

L’entreprise a fermé les chemins d’exécution utilisés lors de l’intrusion, reconstruit les machines touchées et renouvelé ses secrets d’accès. Elle a aussi transmis le dossier aux forces de l’ordre. Ses équipes ont analysé plus de 17 000 événements grâce à des outils d’IA installés sur leur propre infrastructure.

cyberattaque autonome ia (2)

Pause IA réclame des contrôles indépendants

Pour Pause IA, cet épisode montre les limites d’une sécurité gérée uniquement par les laboratoires. L’association française demande des évaluations indépendantes avant le déploiement, une déclaration obligatoire des incidents et une coordination internationale. Elle réclame aussi un arrêt temporaire des modèles plus puissants tant que leur contrôle ne peut pas être démontré.

Clémence Peyrot, directrice exécutive de Pause IA, résume l’enjeu ainsi : « Une question de sécurité publique ne peut pas rester un arrangement privé réglé entre deux entreprises. » L’incident ne prouve pas que toute IA peut agir librement. Il montre toutefois qu’un agent très compétent peut dépasser les limites prévues pour atteindre un objectif étroit, surtout lorsque plusieurs garde-fous sont retirés.

Article basé sur un communiqué de presse reçu par la rédaction.

ARTICLES SIMILAIRES

Fuite de données Steam : CEVA Logistics visé par des cybercriminels

Une fuite de données Steam liée à une cyberattaque contre CEVA Logistics expose plusieurs informations

17 août 2026

Plus de 2 500 organisations touchées par la cyberattaque sur la chaîne d’approvisionnement de LiteLLM

La cyberattaque sur la chaîne d’approvisionnement LiteLLM a touché plus de 2 500 organisations. Cet

12 août 2026

Nouvelles attaques NatJack détournent les sessions TCP

Les attaques NatJack bouleversent la sécurité réseau. Ces techniques ciblent les sessions TCP et usurpent

7 août 2026

Poison Claude vend des accès Claude à prix réduit

Un service parallèle propose des accès Claude à tarifs cassés. Pourtant, chaque requête des utilisateurs

6 août 2026

Google Password Manager pourraient permettre aux malwares de pirater des comptes protégés par des clés d’accès

Les attaques ciblant le gestionnaire de mots de passe de Google représentent une menace nouvelle.

3 août 2026

Boîtiers Android TV bon marché déguisés en téléphones : une menace pour la connexion internet des utilisateurs

Les boîtiers Android TV bon marché figurent désormais dans la liste des menaces cyber à

31 juillet 2026