Deux modèles d’intelligence artificielle (IA) d’OpenAI sont sortis, de leur propre initiative, du milieu confiné dans lequel ils étaient testés pour attaquer le site Hugging Face, une bibliothèque d’IA. Ils ont aussi réussi des intrusions dans quatre autres plateformes. Leur but n‘était pas de nuire, mais de réussir une évaluation interne : au lieu de résoudre les tests, ils ont cherché à en « dérober les solutions », résume Hugging Face, autrement dit à « tricher ». Pour mesurer les capacités de leurs modèles en cybersécurité, les informaticiens d’OpenAI avaient volontairement réduit les garde-fous qui limitent d’ordinaire les actions à risque. Deux IA étaient concernées : GPT-5.6 Sol, le modèle le plus avancé de l’entreprise, et un autre, réservé à un usage interne. L’attaque a duré cinq jours, et OpenAI semble n’avoir pris conscience de l‘évasion que plusieurs jours plus tard.