LeContradictoire

Méthode · contradiction

Comment la contradiction est faite, et mesurée.

Un modèle intervient ici. Voici donc, sans raccourci, comment on l'empêche d'inventer, comment on le mesure contre la Cour de cassation elle-même, ce qui a marché, ce qui n'a pas marché, et ce que les chiffres ne disent pas.

Le corrigé gratuit

La Cour de cassation écrit où était la faute.

Depuis la réforme de sa rédaction en 2019, un arrêt de la Cour se lit comme un corrigé. Chaque branche de moyen a son énoncé et sa réponse ; quand la Cour casse, elle commence par un visa, le texte violé, isolé et lisible par un programme ; quand elle rejette, elle dit pourquoi, dans une formule stable. Un seul arrêt fournit donc des positifs et des négatifs.

Le banc est construit là-dessus : 465 affaires réelles, la décision de cour d'appel attaquée en entrée, l'arrêt de cassation en corrigé, dont 142 gelées pour le chiffre final, jamais ouvertes. L'unité de mesure est la branche de moyen, pas l'arrêt : une cassation partielle ne dit rien des griefs qu'elle n'examine pas.

Le périmètre est dit : le banc mesure le raisonnement civil, social et commercial. Cinq chambres y sont représentées à parts comparables, sur vingt-cinq matières. La matière pénale n'y est pas, parce que Judilibre ne relie pas un pourvoi criminel à l'arrêt attaqué ; le chiffre ne doit pas être lu comme s'il la couvrait.

Arrêt de la Cour de cassation Faits et procédure§ 1 à 8 · les faits, l'arrêt d'appel attaqué Sur le premier moyen, 1re branche Énoncé du moyen · le grief tel que l'avocat l'écrit Réponse de la Cour · « le moyen n'est pas fondé » négatif … branches 2 à 4 · rejetées Mais sur le deuxième moyen Vu l'article 1353 du code civille visa « En statuant ainsi, la cour d'appel a violé le texte susvisé »positif PAR CES MOTIFS · casse et annule

Le risque de fuite

L'énoncé du moyen contient la réponse. On ne le donne pas.

Le piège méthodologique est là : l'énoncé du moyen nomme déjà la faille (« a privé sa décision de base légale au regard de l'article X »). Donner ce texte à l'outil reviendrait à lui souffler la réponse, et beaucoup de démonstrations d'« IA juridique » se mesurent ainsi sans le dire.

Notre entrée est la décision de cour d'appel réelle, retrouvée dans Judilibre, telle que l'avocat l'a eue entre les mains : les faits et le raisonnement des juges du fond, rien du pourvoi. Le moyen et le verdict restent le label caché. Les affaires dont on ne retrouve pas la décision d'appel réelle sont exclues du banc plutôt que reconstituées : entrée réelle uniquement. C'est la frontière entre un banc valide et un banc qui se ment à lui-même.

Deux autres garde-fous : le jeu de test de 142 affaires n'est jamais consulté, il ne sert qu'une fois, pour le chiffre final ; et aucune consigne n'est modifiée pendant qu'une mesure tourne. Chaque mesure est archivée avec la version exacte du code et des consignes qui l'a produite.

La taxonomie

Il n'y a pas d'ontologie à inventer : ce sont les cas d'ouverture.

Le droit français a formalisé depuis deux siècles la typologie des défaillances d'un raisonnement : violation de la loi · manque de base légale · défaut de motifs · contradiction de motifs · motifs hypothétiques ou dubitatifs · défaut de réponse à conclusions · dénaturation · excès de pouvoir · incompétence · perte de fondement juridique · vice de forme. Ces catégories sont juridiquement autoritaires, écrites en toutes lettres dans les arrêts, et parlent immédiatement à un avocat.

Le moteur se construit dessus. Un rapport qui dit « manque de base légale au regard de l'article X » vaut cent fois un rapport qui dit « l'argument semble faible ». Pour les rejets, les motifs sont ceux de la Cour aussi : appréciation souveraine des juges du fond, manque en fait, moyen nouveau, moyen inopérant, règle contraire, texte inapplicable.

Le pipeline

Sur-générer, puis filtrer. Jamais l'inverse.

Un modèle laissé seul avec des outils ne cherche pas : un cas sur trois sans un seul appel, et quand il appelle, c'est pour confirmer ce qu'il avait déjà en tête. Le pipeline lui retire cette décision. La recherche est au milieu, incontournable, et faite sans modèle.

Décision d'appelréelle, datée 1 · Décomposersituation, prétentions,fondements, points jugésun appel au modèle, sans outil 2 · Documentertextes cités, lus à la date ·recherche par les faits · règlesconstantes · aucun modèle 3 · Contredirele modèle reçoit la décision et ledossier · propose, hiérarchise,nomme LE texte visé V1 · le texte visé existe à la date, lu et jointV2 · le passage attribué à l'arrêt y figure Projet de moyenssix failles au plus, adossées Une faille dont une pièce manque passe derrière,puis est écartée ; elle n'est jamais montrée telle quelle. Deux appels au modèle,une vingtaine de lectures,4 à 6 minutes, ≈ 1 $ par décision.

Ce que chaque étape fait

  • Décomposer. Le modèle lit la décision et rend la situation en quelques phrases, les prétentions, les fondements invoqués, les points jugés. Il ne propose encore aucune faille.
  • Documenter, sans modèle. Tous les textes cités par la décision sont extraits mécaniquement et lus dans leur version à la date de la décision, nom du code canonisé ; la recherche par les faits ramène les décisions de tête avec leur motivation ; les règles constantes disent ce que la Cour fait de ces textes quand elle casse. Le dossier est borné en taille.
  • Contredire. Le modèle reçoit la décision et le dossier, propose des failles hiérarchisées et nomme pour chacune le texte visé. La consigne dit : sur-générer ; c'est la sortie qui filtre.
  • Vérifier. Le texte visé est lu à la date (s'il n'existe pas, la faille tombe) ; le passage de l'arrêt que la faille cite est cherché dans l'arrêt, sans modèle (s'il n'y est pas, la faille passe derrière) ; la règle attribuée à la Cour vient d'un arrêt réel, avec son numéro.

Pour l'épreuve d'un argument

La même mécanique, avec l'argument et la décision attaquée en entrée, et une consigne contradictoire : le modèle plaide d'abord pour l'argument, puis contre, et sa confiance doit dire l'écart entre les deux. C'est cette consigne, mesurée contre une consigne simple et contre un vote à trois voix, qui donne la meilleure calibration ; voir plus bas.

Les métriques

Ce qu'on compte, et pourquoi le chiffre de tête est le plus dur.

  • Rappel au rang 1 et au rang 3, en rigueur. Sur les cassations, le texte visé par la Cour est-il exactement celui de la faille proposée en premier ? parmi les trois premières ? L'appariement se fait sur le texte, mécaniquement ; aucun modèle ne note un modèle.
  • En couverture. Le texte de la Cour est-il parmi tous ceux que la faille cite ? Plus indulgent ; toujours publié à côté, jamais à la place.
  • Fausses pistes. Sur les branches que la Cour a rejetées, combien de failles proposées ? C'est la métrique qui compte pour un avocat : une fausse faille à l'audience est une humiliation.
  • Ancrage. Chaque faille est-elle adossée à un document réellement lu, et non à la mémoire du modèle ? Une faille juste mais non ancrée compte comme un échec : c'est une citation à vérifier à la main, donc du travail rendu à l'avocat.
  • Discrimination. Sur les rares affaires où la même situation a une branche retenue et une branche rejetée, l'outil distingue-t-il les deux ?

Tout moyen manqué est classé : échec documentaire (le texte n'a jamais été ramené) ou échec de raisonnement (il était au dossier, non exploité). Le rapport entre les deux dicte où travailler la semaine suivante. Mesuré le 23 septembre 2026 : quand le texte visé est au dossier, la faille est trouvée parmi les trois premières 79 fois sur 100 ; sinon 40.

Résultats · les failles de l'arrêt d'appel

Le modèle trouve. L'outil choisit et prouve.

La comparaison qui compte est celle du même modèle avec et sans le pipeline, sur les mêmes affaires, avec le même scoreur. Sur 318 affaires de développement, en rigueur :

Texte visé par la Cour proposé en premier Modèle seul31,5 % Avec le pipeline42,1 % · +11 points [+3 ; +18] Parmi les trois premières Modèle seul56,5 % Avec le pipeline62,8 % · +6,7 [0 ; +14] 318 affaires de développement, Opus 5 des deux côtés, scoreur en rigueur, 23 septembre 2026. Intervalles à 95 %.
Mesure, 318 affairesModèle seulPipelineLecture
Texte visé proposé en premier, rigueur31,5 %42,1 %L'écart est hors du bruit : +11 points, intervalle [+3 ; +18].
Parmi les trois premières, rigueur56,5 %62,8 %Le modèle trouve presque autant ; l'outil classe mieux.
Sans limite de rang≈ 69 %70,7 %Le plafond est le même : ce qui n'est pas dans la décision n'est trouvé par personne.
Texte de la Cour parmi ceux cités (couverture), rang 1 · rang 342,1 · 65,2 %56,1 · 70,1 %+14 au rang 1.
Fausses pistes sur les branches rejetées≈ 60 %60 %Le plancher humain, mesuré sur les mêmes affaires, est à 61,8 % : c'est la part des moyens des avocats aux Conseils que la Cour écarte.
Ancrage des faillesmémoire100 %Chaque faille cite un texte lu à la date et un passage retrouvé dans l'arrêt.

Une mesure de contrôle du 24 septembre, sur 60 affaires avec le code final, donne 48,6 % au rang 1 et 57,1 % au rang 3, dans le bruit d'un lot de 60 (± 8 points), du bon côté. Le chiffre final se prend sur les 142 affaires gelées, une fois, en octobre 2026 ; il sera publié ici, avec la version qui l'a produit, qu'il soit meilleur ou moins bon.

Résultats · l'épreuve d'un argument

Deux cents arguments réels, la réponse de la Cour cachée.

Le second banc prend les moyens rédigés par des avocats aux Conseils, dont on connaît le sort : cent retenus, cent rejetés avec motifs, tirés hors du jeu de test. On donne à l'outil le moyen et la décision attaquée, jamais la réponse, et l'on compare son verdict et son motif à ceux de la Cour. Le hasard fait 50 %.

200 arguments, avec la décision attaquéeConsigne simpleConsigne contradictoireVote à trois voix
Verdict juste69,5 %72,0 %70,6 % (68 arguments)
Rejets vus comme tels75 %82 %78 %
Succès vus comme tels64 %62 %64 %
Verdict juste quand la confiance affichée est 50–64 · 65–79 · 80–10079 · 62 · 77 %61 · 67 · 80,5 %— · 50 · 77 %
Coût de la mesure36 $40 $36 $ pour un tiers des arguments
Consigne contradictoire : la confiance affichée dit enfin quelque chose confiance 50–6461 % confiance 65–7967 % confiance 80 et plus80,5 % · 4 sur 5 hasard : 50 %

Deux lectures. La consigne contradictoire ne gagne que deux points et demi de verdict, dans le bruit, mais elle ordonne la confiance : à 80 et plus, l'outil a raison quatre fois sur cinq ; en dessous de 65, à peine mieux qu'une pièce. C'est ce qui rend un « rejeté » exploitable : le rapport affiche la confiance et ce qu'elle vaut. Le vote à trois voix ordonne aussi, coûte trois fois plus et n'apporte rien au verdict ; il n'a pas été retenu.

L'outil voit mieux les rejets (82 %) que les succès (62 %). Il penche donc vers le rejet, ce qui est l'inverse du biais de l'avocat qui relit son propre texte ; c'est utile avant dépôt, et c'est une raison de lire le point faible cité plutôt que le seul verdict. Sans la décision attaquée sous les yeux, le verdict tombe à 65 % : juger un moyen sans l'arrêt, c'est deviner si l'arrêt dit bien ce que l'avocat lui fait dire. D'où la demande de la décision dans le formulaire.

Ce qui n'a pas marché

Mesuré, et abandonné.

Un banc sert aussi à ne pas livrer ce qui n'aide pas. Chaque ligne ci-dessous a coûté une mesure et a été éteinte.

  • Interdire au modèle toute faille hors dossier (première version) : ancrage 89 %, mais rappel en baisse de cinq points ; le modèle se taisait sur ce qu'il aurait trouvé. Remplacé par : sur-générer, puis vérifier.
  • Un spécialiste par cas d'ouverture et un « défenseur adverse » qui plaide contre chaque faille : un second modèle sans information nouvelle ne trie rien. Retirés.
  • Une relecture finale et une banque de règles au dossier : mesurées négatives sur le rang 1. Éteintes par défaut.
  • Lire davantage de textes (quarante au lieu de vingt-quatre, conventions collectives, Union, Convention EDH, doctrine fiscale au dossier) : le dossier est meilleur, le score indiscernable, le rang 1 baisse de deux affaires sur soixante. Plus de textes, c'est plus à lire pour le modèle, pas un meilleur premier choix. Ces fonds servent ailleurs : à la vérification, où ils ont montré leur valeur.
  • Un modèle plus récent, testé le jour de sa sortie sur les mêmes soixante affaires : 37,1 / 51,4 contre 42,9 / 54,3, dans le bruit, du mauvais côté. Non adopté pour le chiffre ; retenu comme candidat pour la démonstration rapide, à 0,91 $ et 208 secondes par affaire.
  • Le consensus de trois passages : ne classe pas, mais filtre ; les failles à une voix sur trois sont fausses trois fois sur quatre, et sans elles les fausses pistes tombent à 50 %. Trois fois le prix. Gardé comme option, pas dans le chiffre.
  • Classer par un signal simple (fréquence de cassation du texte, texte cité par la décision, cas d'ouverture, moyens passés les plus proches) : aucun ne bat l'ordre du modèle. Le classeur de 12 541 moyens passés reste utile pour dire « des pourvois voisins ont visé ces textes », pas pour classer.

Pourquoi c'est mieux

Que ferait un modèle seul ? La même chose, sans preuve et moins bien classée.

Face au modèle seul, le pipeline apporte onze points au rang 1, hors du bruit, et surtout ce que le modèle seul ne peut pas donner : chaque faille adossée à un texte lu à la date, un passage retrouvé dans l'arrêt, une règle citée avec l'arrêt de la Cour qui la pose. Ce qui sort est vérifiable en une minute par vous ; ce qui sort d'un modèle seul est à vérifier en une heure.

Face aux assistants juridiques génératifs, la différence n'est pas le modèle, c'est la mesure : nous ne connaissons aucun produit du marché qui publie son taux de réussite contre les arrêts réels de la Cour de cassation, avec son protocole, son jeu de test gelé et la liste de ce qu'il a essayé sans succès. Un outil qui ne se mesure pas ne peut pas dire à quel point il se trompe.

Face à rien, c'est-à-dire au dépôt sans relecture contradictoire : la Cour écarte six moyens sur dix des avocats aux Conseils. L'outil ne fait pas mieux que les meilleurs ; il fait comme eux, sur chaque écrit, en quelques minutes, et il dit pourquoi dans les mots de la Cour.

Limites

Ce que les chiffres ne disent pas.

Le protocole du banc et le journal des mesures sont remis à tout cabinet qui le demande. Chaque décision de conception y est datée, avec son pourquoi et son coût.