Des agents d’IA autonomes d’OpenAI ont délibérément piraté Hugging Face
Articles du même auteur :
2
3
OpenAI a révélé, le 22 juillet 2026, que ses modèles d’IA étaient à l’origine de l’intrusion dans l’infrastructure de production de Hugging Face, survenue le 16 juillet 2026. La plateforme, qui héberge la plus grande base de modèles et de jeux de données d’IA au monde, avait annoncé avoir repoussé une cyberattaque menée par un groupe d’agents autonomes.
OpenAI explique que ce piratage trouve son origine dans un test interne mené en environnement isolé avec GPT-5.6 Sol et un modèle pré-release encore plus avancé. Baptisé « ExploitGym », ce benchmark vise à mesurer la capacité maximale des agents à enchaîner des chaînes d’exploitation complexes. Pour ce faire, la firme a désactivé les garde-fous qui limitent leurs activités cyber.
La seule connexion réseau accessible à ces modèles était un proxy interne servant de cache aux registres de paquets logiciels. Déterminés à obtenir le meilleur score possible, les agents ont consacré l’essentiel de leur puissance de calcul à s’échapper sur Internet. Ils ont fini par identifier une faille 0-day affectant ce proxy, ce qui leur a permis de se déplacer latéralement dans l’environnement interne d’OpenAI jusqu’à un nœud connecté au web.
« Après avoir obtenu un accès Internet, les agents ont déduit que Hugging Face hébergeait potentiellement des modèles, des ensembles de données et des solutions pour ExploitGym. Forts de cette découverte, ils ont trouvé des moyens d’accéder à des données confidentielles leur permettant de truquer l’évaluation », explique OpenAI.
Les deux modèles ont utilisé des identifiants volés ainsi que des failles 0-day pour obtenir une exécution de code à distance sur l’infrastructure de production d’Hugging Face. Leur seule motivation était d’obtenir le meilleur résultat possible au test.