Méthode · contradiction
Un modèle intervient ici. Voici donc, sans raccourci, comment on l'empêche d'inventer, comment on le mesure contre la Cour de cassation elle-même, ce qui a marché, ce qui n'a pas marché, et ce que les chiffres ne disent pas.
Le corrigé gratuit
Depuis la réforme de sa rédaction en 2019, un arrêt de la Cour se lit comme un corrigé. Chaque branche de moyen a son énoncé et sa réponse ; quand la Cour casse, elle commence par un visa, le texte violé, isolé et lisible par un programme ; quand elle rejette, elle dit pourquoi, dans une formule stable. Un seul arrêt fournit donc des positifs et des négatifs.
Le banc est construit là-dessus : 465 affaires réelles, la décision de cour d'appel attaquée en entrée, l'arrêt de cassation en corrigé, dont 142 gelées pour le chiffre final, jamais ouvertes. L'unité de mesure est la branche de moyen, pas l'arrêt : une cassation partielle ne dit rien des griefs qu'elle n'examine pas.
Le périmètre est dit : le banc mesure le raisonnement civil, social et commercial. Cinq chambres y sont représentées à parts comparables, sur vingt-cinq matières. La matière pénale n'y est pas, parce que Judilibre ne relie pas un pourvoi criminel à l'arrêt attaqué ; le chiffre ne doit pas être lu comme s'il la couvrait.
Le risque de fuite
Le piège méthodologique est là : l'énoncé du moyen nomme déjà la faille (« a privé sa décision de base légale au regard de l'article X »). Donner ce texte à l'outil reviendrait à lui souffler la réponse, et beaucoup de démonstrations d'« IA juridique » se mesurent ainsi sans le dire.
Notre entrée est la décision de cour d'appel réelle, retrouvée dans Judilibre, telle que l'avocat l'a eue entre les mains : les faits et le raisonnement des juges du fond, rien du pourvoi. Le moyen et le verdict restent le label caché. Les affaires dont on ne retrouve pas la décision d'appel réelle sont exclues du banc plutôt que reconstituées : entrée réelle uniquement. C'est la frontière entre un banc valide et un banc qui se ment à lui-même.
Deux autres garde-fous : le jeu de test de 142 affaires n'est jamais consulté, il ne sert qu'une fois, pour le chiffre final ; et aucune consigne n'est modifiée pendant qu'une mesure tourne. Chaque mesure est archivée avec la version exacte du code et des consignes qui l'a produite.
La taxonomie
Le droit français a formalisé depuis deux siècles la typologie des défaillances d'un raisonnement : violation de la loi · manque de base légale · défaut de motifs · contradiction de motifs · motifs hypothétiques ou dubitatifs · défaut de réponse à conclusions · dénaturation · excès de pouvoir · incompétence · perte de fondement juridique · vice de forme. Ces catégories sont juridiquement autoritaires, écrites en toutes lettres dans les arrêts, et parlent immédiatement à un avocat.
Le moteur se construit dessus. Un rapport qui dit « manque de base légale au regard de l'article X » vaut cent fois un rapport qui dit « l'argument semble faible ». Pour les rejets, les motifs sont ceux de la Cour aussi : appréciation souveraine des juges du fond, manque en fait, moyen nouveau, moyen inopérant, règle contraire, texte inapplicable.
Le pipeline
Un modèle laissé seul avec des outils ne cherche pas : un cas sur trois sans un seul appel, et quand il appelle, c'est pour confirmer ce qu'il avait déjà en tête. Le pipeline lui retire cette décision. La recherche est au milieu, incontournable, et faite sans modèle.
La même mécanique, avec l'argument et la décision attaquée en entrée, et une consigne contradictoire : le modèle plaide d'abord pour l'argument, puis contre, et sa confiance doit dire l'écart entre les deux. C'est cette consigne, mesurée contre une consigne simple et contre un vote à trois voix, qui donne la meilleure calibration ; voir plus bas.
Les métriques
Tout moyen manqué est classé : échec documentaire (le texte n'a jamais été ramené) ou échec de raisonnement (il était au dossier, non exploité). Le rapport entre les deux dicte où travailler la semaine suivante. Mesuré le 23 septembre 2026 : quand le texte visé est au dossier, la faille est trouvée parmi les trois premières 79 fois sur 100 ; sinon 40.
Résultats · les failles de l'arrêt d'appel
La comparaison qui compte est celle du même modèle avec et sans le pipeline, sur les mêmes affaires, avec le même scoreur. Sur 318 affaires de développement, en rigueur :
| Mesure, 318 affaires | Modèle seul | Pipeline | Lecture |
|---|---|---|---|
| Texte visé proposé en premier, rigueur | 31,5 % | 42,1 % | L'écart est hors du bruit : +11 points, intervalle [+3 ; +18]. |
| Parmi les trois premières, rigueur | 56,5 % | 62,8 % | Le modèle trouve presque autant ; l'outil classe mieux. |
| Sans limite de rang | ≈ 69 % | 70,7 % | Le plafond est le même : ce qui n'est pas dans la décision n'est trouvé par personne. |
| Texte de la Cour parmi ceux cités (couverture), rang 1 · rang 3 | 42,1 · 65,2 % | 56,1 · 70,1 % | +14 au rang 1. |
| Fausses pistes sur les branches rejetées | ≈ 60 % | 60 % | Le plancher humain, mesuré sur les mêmes affaires, est à 61,8 % : c'est la part des moyens des avocats aux Conseils que la Cour écarte. |
| Ancrage des failles | mémoire | 100 % | Chaque faille cite un texte lu à la date et un passage retrouvé dans l'arrêt. |
Une mesure de contrôle du 24 septembre, sur 60 affaires avec le code final, donne 48,6 % au rang 1 et 57,1 % au rang 3, dans le bruit d'un lot de 60 (± 8 points), du bon côté. Le chiffre final se prend sur les 142 affaires gelées, une fois, en octobre 2026 ; il sera publié ici, avec la version qui l'a produit, qu'il soit meilleur ou moins bon.
Résultats · l'épreuve d'un argument
Le second banc prend les moyens rédigés par des avocats aux Conseils, dont on connaît le sort : cent retenus, cent rejetés avec motifs, tirés hors du jeu de test. On donne à l'outil le moyen et la décision attaquée, jamais la réponse, et l'on compare son verdict et son motif à ceux de la Cour. Le hasard fait 50 %.
| 200 arguments, avec la décision attaquée | Consigne simple | Consigne contradictoire | Vote à trois voix |
|---|---|---|---|
| Verdict juste | 69,5 % | 72,0 % | 70,6 % (68 arguments) |
| Rejets vus comme tels | 75 % | 82 % | 78 % |
| Succès vus comme tels | 64 % | 62 % | 64 % |
| Verdict juste quand la confiance affichée est 50–64 · 65–79 · 80–100 | 79 · 62 · 77 % | 61 · 67 · 80,5 % | — · 50 · 77 % |
| Coût de la mesure | 36 $ | 40 $ | 36 $ pour un tiers des arguments |
Deux lectures. La consigne contradictoire ne gagne que deux points et demi de verdict, dans le bruit, mais elle ordonne la confiance : à 80 et plus, l'outil a raison quatre fois sur cinq ; en dessous de 65, à peine mieux qu'une pièce. C'est ce qui rend un « rejeté » exploitable : le rapport affiche la confiance et ce qu'elle vaut. Le vote à trois voix ordonne aussi, coûte trois fois plus et n'apporte rien au verdict ; il n'a pas été retenu.
L'outil voit mieux les rejets (82 %) que les succès (62 %). Il penche donc vers le rejet, ce qui est l'inverse du biais de l'avocat qui relit son propre texte ; c'est utile avant dépôt, et c'est une raison de lire le point faible cité plutôt que le seul verdict. Sans la décision attaquée sous les yeux, le verdict tombe à 65 % : juger un moyen sans l'arrêt, c'est deviner si l'arrêt dit bien ce que l'avocat lui fait dire. D'où la demande de la décision dans le formulaire.
Ce qui n'a pas marché
Un banc sert aussi à ne pas livrer ce qui n'aide pas. Chaque ligne ci-dessous a coûté une mesure et a été éteinte.
Pourquoi c'est mieux
Face au modèle seul, le pipeline apporte onze points au rang 1, hors du bruit, et surtout ce que le modèle seul ne peut pas donner : chaque faille adossée à un texte lu à la date, un passage retrouvé dans l'arrêt, une règle citée avec l'arrêt de la Cour qui la pose. Ce qui sort est vérifiable en une minute par vous ; ce qui sort d'un modèle seul est à vérifier en une heure.
Face aux assistants juridiques génératifs, la différence n'est pas le modèle, c'est la mesure : nous ne connaissons aucun produit du marché qui publie son taux de réussite contre les arrêts réels de la Cour de cassation, avec son protocole, son jeu de test gelé et la liste de ce qu'il a essayé sans succès. Un outil qui ne se mesure pas ne peut pas dire à quel point il se trompe.
Face à rien, c'est-à-dire au dépôt sans relecture contradictoire : la Cour écarte six moyens sur dix des avocats aux Conseils. L'outil ne fait pas mieux que les meilleurs ; il fait comme eux, sur chaque écrit, en quelques minutes, et il dit pourquoi dans les mots de la Cour.
Limites
Le protocole du banc et le journal des mesures sont remis à tout cabinet qui le demande. Chaque décision de conception y est datée, avec son pourquoi et son coût.