Preuves
Le corrigé existe. Quand la Cour de cassation casse, elle écrit où était la faute ; quand elle rejette, elle dit pourquoi. Chaque contrôle est mesuré contre ces réponses réelles, sur un jeu de test gelé que personne ne regarde.
Résultats, protocole, erreurs et limites sont publiés ensemble : ce que nous avons testé, sur quelles données, ce qui en est sorti, ce que l'outil rate, et comment le contrôler vous-même.
Ce que nous avons testé
On prend des écrits réels, on vérifie chaque citation, et l'on relit chaque alerte contre sa source. Puis on abîme des citations à dessein et l'on compte celles que l'outil retrouve.
On donne à l'outil un argument réel d'avocat aux Conseils et la décision attaquée, jamais la réponse de la Cour, et l'on compare son issue estimée et son motif à ceux de la Cour.
On donne la décision d'appel réelle, rien du pourvoi. L'outil propose. On ouvre ensuite l'arrêt de cassation et l'on compare le texte visé par la Cour à ceux proposés. L'appariement est mécanique : aucun modèle ne note un modèle.
Sur quelles données
Les conclusions des parties telles que les arrêts les reprennent, sans correction. Quatre passages successifs pour trouver les défauts de l'outil avant de compter les erreurs des écrits.
Les écrits des spécialistes du pourvoi, pris dans les moyens annexés aux arrêts de la Cour.
Des moyens d'avocats aux Conseils dont on connaît le sort, tirés hors du jeu de test, jugés avec la décision attaquée sous les yeux.
La décision d'appel réelle en entrée, l'arrêt de cassation en corrigé. Les 142 gelées ne sont jamais ouvertes ; elles servent une fois, pour le chiffre final d'octobre 2026.
Périmètre : civil, social, commercial, cinq chambres à parts comparables, vingt-cinq matières. La matière pénale n'y est pas, parce que Judilibre ne relie pas un pourvoi criminel à l'arrêt attaqué.
Les résultats
citations d'écritures réelles identifiées fausses ou erronées, avec la source. 95,3 % confirmées. Une erreur glissée à dessein est détectée 86 à 100 % du temps selon son type.
des réponses de la Cour retrouvées sur 200 arguments réels. Quand l'outil se dit sûr, il a raison quatre fois sur cinq. Il voit mieux les rejets (82 %) que les succès (62 %).
la faille retenue par la Cour est parmi les trois premières proposées ; 4 sur 10 en premier. Propositions écartées par la Cour : 60 %, contre 62 % pour les avocats aux Conseils sur les mêmes affaires.
| Mesure | Résultat | Lecture |
|---|---|---|
| Citations confirmées à leur source, 5 915 lues | 95,3 % | 179 non vérifiables dites telles quelles ; 99 fausses, listées une à une dans le dossier de preuve. |
| Erreur glissée à dessein, détectée | 86 à 100 % | Mauvais code, article abrogé, date ou chambre fausse : 100 %. Numéro d'article inexistant : 85 %, quand le numéro abîmé existe aussi. |
| Issue de la Cour retrouvée, 200 arguments | 72 % | Hasard : 50 %. Consigne contradictoire, le modèle plaide pour puis contre. |
| Rejets vus comme tels · succès vus comme tels | 82 % · 62 % | L'outil penche vers le rejet, l'inverse du biais de l'auteur qui relit son texte. |
| Issue estimée juste quand la confiance affichée dépasse 80 | 4 sur 5 | Entre 65 et 79 : deux fois sur trois. En dessous : à peine mieux qu'une pièce. Le rapport l'affiche. |
| Texte visé par la Cour proposé en premier, 318 affaires | 42,1 % | Modèle seul, même scoreur : 31,5 %. L'écart, +11 points, est hors du bruit. |
| Parmi les trois premières propositions | 62,8 % | Modèle seul : 56,5 %. Sans limite de rang, les deux plafonnent vers 70 % : ce qui n'est pas dans la décision n'est trouvé par personne. |
| Propositions écartées par la Cour | 60 % | Plancher humain sur les mêmes affaires : 61,8 % des moyens des avocats aux Conseils. |
Mesures du 23 au 25 septembre 2026 sur le jeu de développement. Le chiffre final du jeu de test des failles se prend sur les 142 affaires gelées, une fois, en octobre 2026, et sera publié ici tel quel.
Les faux positifs et les erreurs
Alertes à tort sur les citations. Sur le premier jeu de test de 623 citations : aucune. Sur le deuxième, 77 alertes ont été relues une à une : 46 venaient d'un défaut de l'outil, chacun corrigé, testé hors réseau et consigné ; les autres étaient de vraies erreurs des écrits. Sur les moyens des avocats aux Conseils, dix-neuf « version discordante » à tort tenaient à une seule règle mal posée, une rédaction antérieure légitime, corrigée depuis. Sur le dernier passage, une seule alerte à tort, corrigée.
Ce que la détection manque. Treize numéros d'article abîmés sur quatre-vingt-cinq n'ont pas été vus : le numéro abîmé existait aussi. Seul un passage cité peut trahir cette erreur-là, et c'est pourquoi le rapport pousse à citer.
Ce que l'épreuve d'arguments rate. Il voit un succès sur trois comme un rejet. Il décourage donc parfois un bon moyen ; c'est la raison pour laquelle il cite le point faible au lieu de conclure seul, et affiche ce que vaut sa confiance.
Ce que le chercheur de failles rate. Quand le texte visé par la Cour n'est nulle part dans la décision ni dans les décisions voisines, il le trouve deux fois sur cinq. Quand le texte est au dossier, quatre fois sur cinq.
Ce que l'outil ne sait pas faire
Contrôler le protocole
L'énoncé du moyen, qui nomme déjà la faille, n'est jamais donné à l'outil. Une affaire dont on ne retrouve pas la décision d'appel réelle est exclue plutôt que reconstituée.
142 affaires jamais ouvertes, qui ne servent qu'une fois. Les chiffres de développement sont dits comme tels.
Chaque mesure est archivée avec la version exacte du code et des consignes qui l'a produite, et son coût.
Si la source donne raison à l'écrit, c'est un défaut de l'outil : corrigé, testé, consigné. Sinon, l'alerte entre dans le dossier de preuve.
Sept variantes mesurées et abandonnées, dont un modèle plus récent et un dossier plus riche, sont listées dans les dossiers de méthode.
Le protocole complet, le journal des corrections et le dossier des 99 citations fausses avec leur source sont remis à tout cabinet qui en fait la demande.
Le protocole, le journal et le dossier de preuve sont à votre disposition. Une alerte à tort nous intéresse plus qu'un compliment.
Résultats complets
Extraction, lecture à la date, chaînage « cassé depuis », les quatre jeux de test, la détection par type d'erreur, les 46 défauts corrigés.
Lire le dossier Dossier 2Le corrigé gratuit, le risque de fuite, le pipeline, les métriques, modèle seul contre pipeline, les 200 arguments, ce qui n'a pas marché.
Lire le dossier Dossier 3Sept serveurs, un noyau commun, la date butoir, les clés canoniques, la robustesse, ce que le fond ramène.
Lire le dossier