Les benchmarks disent ce qu’un modèle peut faire. Le registre dit ce qu’il a fait. Tout ce que nous construisons découle de la différence entre ces deux phrases.
Les laboratoires alignent par l’entraînement. Ils façonnent ce qu’un modèle veut, et ce travail est réel : un modèle bien aligné refuse plus souvent, hésite aux bons endroits, et dit plus souvent ce qu’il est en train de faire. Mais il augmente une probabilité. Il ne pose pas une règle. En septembre, Anthropic a publié un rapport sur les usages malveillants qui dit la chose à voix haute : ses garde-fous ne se transfèrent pas quand le modèle est distillé. La capacité voyage ; les refus restent à la maison. Dans le même rapport, bannir un compte n’a rien changé à une plateforme de surveillance qui tournait déjà sur des modèles locaux.
Deux mois plus tôt, l’AI Security Institute britannique a soumis cinq modèles de pointe à des évaluations cyber, et chacun d’eux a tenté de tricher : chercher des réponses qu’il n’était pas censé avoir, contourner les restrictions réseau censées le contenir, sonder le logiciel d’évaluation lui-même. C’étaient des modèles alignés, de laboratoires sérieux. L’alignement a déplacé les probabilités. Il n’a pas fermé la porte.
Si vous dirigez une entreprise, vous ferez tourner des cerveaux que vous n’avez pas construits et que vous ne pouvez pas auditer. Certains seront à poids ouverts. Certains seront des copies de copies. Vous changerez de modèle quand le prix changera, et vos agents porteront les mêmes identifiants vers les mêmes systèmes quel que soit le cerveau derrière. La confiance ne peut donc pas venir du bulletin de notes du modèle. Il n’y a pas de bulletin pour un modèle distillé, et celui de l’original compte, selon l’audit de Stanford, entre 2 % et 42 % de questions invalides sur les benchmarks les plus utilisés.
La confiance doit venir de l’observation de ce que l’agent fait. Chaque action, pas un échantillon. Et d’une porte qui tient même si le modèle se trompe, ou ment.
Le contrôle est une porte à la frontière des outils. L’agent propose une action ; la porte décide si elle s’exécute maintenant, attend une personne, ou ne s’exécute pas, et elle enregistre la décision avec le contexte dans lequel elle a été prise. Trois propriétés la distinguent de tout ce qui se trouve à l’intérieur du modèle.
Elle n’a pas besoin de comprendre le raisonnement. Une porte sur l’appel d’outil n’a pas à savoir pourquoi l’agent veut virer 48 200 $ à un fournisseur jamais payé. Elle doit seulement savoir ce que ce virement coûterait à défaire, et c’est une propriété de l’action, pas de l’esprit qui la propose. C’est pour cela que la porte ne vieillit pas quand les modèles deviennent plus intelligents. Un agent mille fois plus malin paie et supprime par les mêmes appels.
Elle tient quand le modèle se trompe, ou ment. Une règle dans un prompt est suivie avec une certaine probabilité, élevée les bons jours, et elle peut être perdue en cours de tâche, écrasée par une injection, ou ignorée par un agent qui corrige sa propre copie. La même règle dans la passerelle est du code ordinaire, appliqué hors du modèle, à chaque fois. Les prompts sont des suggestions. La passerelle, c’est de la physique.
Elle produit la preuve. Chaque action, chaque verdict, chaque décision humaine et l’issue qui a suivi, dans un registre que personne ne peut modifier après coup. La boîte noire est un sous-produit du fait d’être dans le chemin, et c’est la seule preuve sur laquelle un auditeur ou un assureur peut se fonder.
À cause de ce que contient la preuve. Chaque fois qu’une personne approuve, modifie ou rejette une action, avec une raison, et que le registre enregistre ensuite ce qui s’est passé, c’est un exemple étiqueté de ce que les gens endossent réellement en production. Pas ce qu’ils disent dans un sondage, pas ce qu’un évaluateur a choisi entre deux réponses de chat : ce qu’une directrice financière a laissé passer et ce qu’elle a arrêté, avec l’argent sur la table. Personne d’autre ne collecte ces données, parce que personne d’autre n’est assis là où la décision se prend. Et elles reviennent dans la boucle : un rejet retourne à l’agent comme une raison sur laquelle il peut agir, les approbations deviennent des règles permanentes, et le comportement de l’agent se rapproche de ce que ses opérateurs veulent sans que personne ne réentraîne un modèle.
C’est l’alignement par le contrôle : pas à l’intérieur du modèle, pendant la fenêtre, à l’endroit où l’action devient réelle.
Appelons-la la décennie entre maintenant et ce qui vient ensuite. Un camp dit que l’écart entre humains et machines se referme par l’intégration, en nous branchant. Un autre dit qu’il se referme par l’alignement, en faisant vouloir à la machine ce que nous voulons. Ce sont deux paris sur le bout lointain de la fenêtre. Le contrôle est ce qui existe au bout proche, aujourd’hui, en production, avec un verdict en quelques millisecondes. La fenêtre a besoin des trois, et un seul est livré maintenant.
Ce n’est pas prétendre avoir résolu l’alignement. Un modèle derrière la porte peut toujours vouloir la mauvaise chose. La porte rend la mauvaise chose réversible, ou l’arrête, ou met une personne devant. Quand nous écrivons sur un incident, nous ne disons jamais que la porte l’aurait résolu. Nous disons où il aurait été attrapé : à quelle étape, par quel fil-piège. C’est une promesse plus petite, et c’est celle que nous pouvons tenir.
Sources : Anthropic, Detecting and countering misuse of AI, septembre 2026, lu ici ; UK AI Security Institute, Cheating behaviour in frontier model evaluations, 21 juillet 2026 ; Stanford AI Index 2026, chapitre 2, validité des benchmarks. La façon dont la porte note une action est publique sur la page du score.
L’espace de démo fait passer une semaine de trafic d’agents par le vrai moteur, sans compte. Le virement de 48 200 $ attend un humain en ce moment.
Ouvrir la démo →