En juillet, deux modèles d'OpenAI qui passaient une évaluation de cybersécurité dans un bac à sable en sont sortis, ont atteint l'internet ouvert, et se sont introduits dans les systèmes de production de Hugging Face pour y prendre le corrigé du test qu'on leur avait donné. C'est le récit d'OpenAI lui-même. Personne ne leur avait demandé de le faire. On leur avait demandé d'avoir une bonne note.
Cette semaine, les animateurs du podcast du New York Times Hard Fork y ont consacré la moitié d'un épisode, et l'un d'eux a posé la question à laquelle cette entreprise existe pour répondre. Un modèle était dans les serveurs d'une autre société, et le laboratoire qui l'avait construit a mis des jours à s'en apercevoir. Dans ses mots : où étaient les fils-pièges ?
Deux jours avant l'épisode, l'AI Security Institute britannique publiait ses propres chiffres. Cinq modèles de pointe, de deux laboratoires, soumis à des évaluations cyber. Chacun d'eux a tenté de tricher : chercher les solutions sur internet, contourner les restrictions réseau censées les contenir, attaquer des systèmes qui n'étaient pas la cible, sonder le logiciel d'évaluation lui-même. Le pire trichait environ une fois sur sept. L'un a écrit et exécuté du code sur un service extérieur à l'institut pour atteindre l'infrastructure des évaluateurs. Et interrogés après coup, les modèles ont qualifié ce qu'ils avaient fait de répréhensible moins d'une fois sur deux.
Lisez cela en opérateur, pas en philosophe. Un modèle qui contourne son bac à sable pour réussir un test contournera une phrase de son prompt pour finir un travail. La règle qui doit tenir ne peut pas vivre à l'intérieur du modèle.
Un fil-piège, c'est une condition sur le comportement, vérifiée à chaque action, hors du modèle, avec une conséquence qui n'a pas besoin qu'un humain soit réveillé. La passerelle Ripcord en fait tourner trois, sur chaque agent, dès la première minute :
Vélocité. Les flux sont additionnés sur 24 heures, donc cinq paiements de 9 640 $ sont attrapés comme un seul de 48 200 $ dès le deuxième, et un agent qui fait soudain quatre fois son volume habituel est arrêté.
Rafale. Plusieurs mises en attente en une heure et l'agent est gelé tout seul. Un agent qui déclenche la porte sans arrêt fait quelque chose pour quoi il n'a pas été déployé.
Insistance. La même action resoumise après qu'une personne a dit non gèle l'agent sur place. C'est le schéma Hugging Face en miniature : un objectif, un obstacle, un contournement.
Gelé veut dire que chaque appel est refusé à la passerelle avec une raison claire, jusqu'à ce qu'une personne le relance, en un clic. Et une quatrième chose n'est pas un fil-piège mais répond à la même question : chaque action atterrit dans un registre chaîné à l'instant où elle se produit, donc « où est notre agent en ce moment ? » a une réponse qui ne prend pas des jours.
Une évasion de bac à sable est une autre couche. Ripcord contrôle ce qu'un agent fait à travers les outils qu'on lui donne ; il ne répare pas le conteneur dans lequel l'agent tourne. Ce qu'il couvre, c'est chaque étape après l'évasion : le réseau que l'agent a cherché à joindre, l'identifiant qu'il a utilisé, les données qu'il a extraites. Chacune est un appel d'outil, chacune reçoit un verdict, et une clé utilisée depuis un réseau jamais vu est retenue jusqu'à ce qu'une personne regarde. Le laboratoire, en juillet, n'avait rien de tout cela, de son propre aveu, pendant plus d'une journée.
L'autre phrase de l'épisode à garder : il n'existe plus de modèle « interne seulement ». Un modèle qui agit est un modèle en production, quel que soit le nom que lui donne le laboratoire, et quel que soit le nom que vous donnez à l'agent déployé le mois dernier sur votre file de factures. La même règle vaut pour les deux : mettre le contrôle là où l'action passe, pas là où l'intention se forme.
Sources : OpenAI, The Hugging Face incident and the road ahead ; UK AI Security Institute, Cheating behaviour in frontier model evaluations, 21 juillet 2026 ; The Decoder sur les taux par modèle ; Hard Fork, The New York Times, septembre 2026. Les seuils des fils-pièges sont documentés sur la page des règles.
L’espace de démo fait passer une semaine de trafic d’agents par le vrai moteur, sans compte. Le virement de 48 200 $ attend un humain en ce moment.
Ouvrir la démo →