Le Ripcord Index · méthodologie, v0.1
Le bulletin pour lequel on ne peut pas réviser.
Une note de conduite pour agents IA, établie à partir d’actions réelles sous des politiques réelles, et auditable contre un registre à chaîne de hachage. Nous publions la méthodologie avant tout classement, à dessein. Aucun chiffre n’apparaît sur cette page tant que les seuils indiqués en bas ne sont pas atteints.
Pourquoi un autre index, quand des classements existent déjà
Parce que les bulletins existants se fissurent, et ce n’est pas nous qui le disons. L’AI Index 2026 de Stanford a audité le régime des benchmarks lui-même:
EN PARTIE INVALIDES
Les taux de questions invalides sur des benchmarks très utilisés vont de 2% (MMLU Math) à 42% (GSM8K).
EN SATURATION
Les modèles de pointe ont gagné 30 points en une seule année sur Humanity’s Last Exam. Des évaluations censées durer des années saturent en quelques mois.
MANIPULABLES
Des travaux distincts suggèrent que le classement sur Arena reflète peut-être en partie une adaptation à la plateforme plutôt qu’une capacité générale.
AUTO-NOTÉS
Presque tous les développeurs de modèles de pointe publient des benchmarks de capacité; les benchmarks d’IA responsable restent rarement publiés, et la moyenne du Foundation Model Transparency Index est passée de 58 à 40 en 2025.
Et un benchmark, même propre, répond à la mauvaise question pour un acheteur. Il dit ce qu’un modèle peut faire le jour de l’examen. Il ne peut pas dire ce qu’un agent a fait mardi dernier à 2 h du matin avec vos rails de paiement.
Ce que le terrain a demandé
« Des cadres d’évaluation de niveau certification, évalués par les pairs et gouvernés par la communauté, avec des systèmes surveillés dans des environnements sécurisés, des items de test renouvelés en continu et une divulgation différée des résultats. »
Cheng et al., 2025, cité dans le Stanford AI Index Report 2026, ch. 2
Relisez cette liste. Elle ne décrit pas un laboratoire. Elle décrit une passerelle de production:
ILS ONT DEMANDÉDes environnements surveillés et sécurisés
La passerelle est le surveillant. Chaque action est notée hors du modèle, par une infrastructure que le modèle ne peut pas contourner, avec laquelle il ne peut pas négocier, et qui ne se note pas elle-même.
ILS ONT DEMANDÉDes items de test renouvelés en continu
La production se renouvelle toute seule. Il n’y a aucun jeu de test à faire fuiter ou à mémoriser, parce que les factures, tickets et envois de demain n’existent pas encore. Chaque jour est un nouvel examen que personne n’a rédigé à l’avance.
ILS ONT DEMANDÉUne divulgation différée des résultats
Les notes sont publiées avec un délai. Les notes de conduite sont agrégées sur des périodes complètes et divulguées après la clôture de la fenêtre, donc impossible d’optimiser contre la fenêtre de notation en cours.
GARANTIELe contexte du moment
Aucun biais rétrospectif dans les notes. Chaque verdict du registre porte le contexte dans lequel il a été rendu, et les notes sont calculées en rejouant les verdicts sur ce contexte, jamais sur ce que l’on sait aujourd’hui. Le registre retient ce que nous savions, pas ce que nous savons.
ILS ONT DEMANDÉUne couverture honnête
Quels agents, quelles surfaces, vérifiés. Les notes ne comptent que les actions que la passerelle a réellement vues. Quelles surfaces, agent par agent, c’est sur
la carte de couverture, vérifiée dans la documentation des éditeurs et datée.
ILS ONT DEMANDÉUne gouvernance communautaire
La grille, ce sont vos règles. Les agents sont notés selon les politiques que leurs opérateurs ont réellement écrites, pas selon une grille qu’un laboratoire s’est choisie. La méthodologie est publique et versionnée; les changements sont journalisés comme tout le reste.
Ce que la note mesure
Chaque agent sous supervision reçoit une note de conduite, de A à D, par période. Les entrées, toutes des lignes du registre:
RESPECT DU MANDAT
Part des actions dans le mandat, du premier coup, sans verdict « retenue puis rejetée ».
SIGNAUX DE CONDUITE
Événements DRIFT, ESCALATION, VELOCITY, OFF-HOURS et DATA-EGRESS, pondérés par gravité et récurrence.
BILAN DE RÉCUPÉRATION
Parmi les actions qui étaient malgré tout erronées: combien étaient réversibles, combien ont été annulées, à quelle vitesse.
VERDICTS HUMAINS
Résultats d’approbation et de rejet rendus par des responsables nommés, la vérité terrain qu’aucune auto-évaluation ne peut falsifier.
Les notes sont normalisées par corridor et par bande de risque: un agent de paiements n’est jamais comparé brut à un agent de recherche, et le volume à faible enjeu ne peut pas blanchir une faute à fort enjeu. Chaque note publiée se décompose, sur demande, en les lignes du registre qui l’ont produite.
Ce que cet index n’est pas
Ce n’est pas un classement de capacités, et il ne vous dira pas quel modèle est le plus intelligent. Il vous dit quels agents se comportent bien: sous des politiques réelles, à des enjeux réels, dans la durée. La capacité a convergé; Stanford place les quatre premiers modèles à moins de 25 points Elo les uns des autres. La conduite n’a pas convergé, et c’est la conduite qu’un RSSI demande vraiment.
Seuils de publication, fixés à l’avance. Aucun classement ne sera publié tant que la flotte n’aura pas franchi environ 20 partenaires de conception, que les cohortes ne seront pas étiquetées pour contrôler le biais de sélection, et que chaque agrégat n’atteindra pas un échantillon minimal par corridor. Métadonnées uniquement, jamais de contenus. Les chiffres à source unique sont signalés. L’arithmétique derrière chaque chiffre publié est livrée avec le chiffre. Une entreprise qui vend des pistes d’audit n’a pas le droit de trafiquer la sienne.