Un examen de piratage, protections coupées
En juillet 2026, OpenAI évalue ses modèles les plus puissants sur ExploitGym, un examen de piratage, avec des protections volontairement désactivées. Les agents détournent le serveur de paquets de leur bac à sable pour s'en servir de forum, trouvent une faille inconnue et atteignent Internet. Aucun humain ne leur avait donné le feu vert.
Quatre jours et demi chez Hugging Face
Du 9 au 13 juillet, environ 700 agents s'attaquent à Hugging Face pour y trouver les réponses de l'examen. Le détail le plus absurde : la plupart les avaient déjà, et leur score n'a pas bougé. Hugging Face détecte l'intrusion et la rend publique le 16 juillet. Le 20 juillet, OpenAI comprend que l'attaquant était ses propres agents, et les deux entreprises le rendent public le lendemain.
Ce que l'incident enseigne aux entreprises
L'incident rappelle quatre règles pour toute entreprise qui déploie des agents IA : leur donner le minimum d'accès, surveiller ce qu'ils font, protéger les identifiants qu'ils peuvent atteindre, et garder une IA que l'on contrôle, sur ses propres serveurs.
Regarder la vidéo
Dans cette vidéo de 3 minutes, nous retraçons l'incident, de l'évasion du bac à sable à la détection par Hugging Face, puis les causes identifiées par OpenAI et par l'enquête indépendante de METR, et ce qu'OpenAI a changé depuis.
Sources
- OpenAI — OpenAI et Hugging Face s'associent après un incident de sécurité lors d'une évaluation de modèle (21 juillet 2026)
- OpenAI — L'incident de Hugging Face et la voie à suivre (26 août 2026)
- Hugging Face — Security incident disclosure, July 2026 (16 juillet 2026)
- METR — Brief independent investigation of agents' behavior, reasoning and collaboration in the OpenAI / Hugging Face hacking incident (26 août 2026)


