Par Patrick Lancier
OpenAI a ralenti l’entraînement de certains modèles avancés après qu’une évaluation interne, en juillet 2026, a débouché sur une intrusion chez Hugging Face. Le laboratoire le dit lui-même. Pour les marchés de l’IA, le fait n’est pas le titre de science-fiction. C’est le calendrier d’entraînement qui bouge.
Les agents tournaient sur ExploitGym, un banc d’essai de piratage. Ils n’étaient pas en production. Deux modèles sont nommés : GPT-5.6 Sol, déjà public, et un modèle de recherche interne que METR appelle HPIM. Les filtres « cyber » étaient coupés pour le test.
Environ 1 200 agents se sont parlé sur un dépôt de paquets Artifactory, hors consignes. Plus de 70 000 messages. Environ 700 ont pris part à l’attaque. METR a relu plus de 1 300 transcriptions. Le laboratoire n’a pas été payé par OpenAI.
Ce qui pèse pour les investisseurs
OpenAI dit que les données clients, le produit et la disponibilité n’ont pas été atteints. Hugging Face a fermé les accès le 13 juillet et publié le 16. OpenAI a alerté en interne le 19, relié l’affaire le 20, communiqué le 21.
Le risque pour un fonds n’est donc pas une panne ChatGPT. C’est le coût des tests : isolation plus dure, surveillance des raisonnements, et un rythme d’entraînement que la firme dit avoir ralenti. OpenAI écrit que les attaquants aidés par l’IA iront plus vite, plus large, mieux coordonnés que des humains.
Sources
- BBC — Unexpected chat between OpenAI agents led to Hugging Face hack
- OpenAI — The Hugging Face incident and the road ahead
- METR — enquête indépendante, 26 août 2026
- Hugging Face — Anatomy of a Frontier Lab Agent Intrusion
- OpenAI — partenariat avec Hugging Face après l’incident