Comment c’est mesuré

N’importe quel système de ce type peut avoir l’air de marcher sur trois questions bien choisies. Celui-ci a été mesuré sur 142 questions écrites et annotées à la main, et les résultats gênants sont publiés avec les autres.

Chaque palier ajoute une seule chose

Six versions du même système, chacune ajoutant exactement une capacité à la précédente. L’écart entre deux lignes est donc attribuable à cette capacité, et pas à un paquet de changements. Deux mesures par ligne : ce qu’il retrouve, et ce qu’il retrouve qui ne s’applique plus.

L’article qui tranche est retrouvéDes articles abrogés sont servis au modèle (moins c’est mieux)

baseline
découpage à taille fixe
84,2 %
66,7 %
article
découpage par article
85,8 %+1,7
67,5 %
hybrid
+ recherche lexicale
78,3 %−7,5
61,7 %
rerank
+ reclassement
87,5 %+9,2
62,5 %
rewrite
+ reformulation
88,3 %+0,8
63,3 %
filtered
+ filtre de date et précédence
90,8 %+2,5
0,0 %

La recherche lexicale, ajoutée au palier « hybrid », a fait baisser la performance de 7,5 points. C’est publié tel quel. Un tableau où chaque ligne améliore la précédente est un tableau que personne n’a vraiment mesuré : on y a seulement gardé ce qui arrangeait. Le reclassement a ensuite récupéré cette perte, et davantage.

Le filtre de date est le changement qui compte le plus. Sans lui, 63,3 % des questions remontaient au moins un article abrogé, et le modèle répondait correctement à partir d’un texte qui ne s’applique plus. Aucune mesure d’exactitude ne voit cette erreur : la réponse est bien rédigée et bien sourcée, simplement fausse. Avec le filtre : 0,0 %.

palierce qu’il ajoutearticle trouvéréponses justescitationsabrogés€ / question
baselinedécoupage à taille fixe84,2 % 45,0 % – 76,7 %58,7 %66,7 %0.0016
articledécoupage par article85,8 % (+1,7)46,7 % – 80,8 %57,9 %67,5 %0.0020
hybrid+ recherche lexicale78,3 % (−7,5)45,8 % – 74,2 %58,2 %61,7 %0.0077
rerank+ reclassement87,5 % (+9,2)49,2 % – 81,7 %59,9 %62,5 %0.0040
rewrite+ reformulation88,3 % (+0,8)50,0 % – 81,7 %58,2 %63,3 %0.0042
filtered+ filtre de date et précédence90,8 % (+2,5)44,2 % – 80,0 %69,7 %0,0 %0.0045

Pourquoi l’exactitude est publiée comme une fourchette

Tous les autres chiffres de cette page se vérifient sans connaître le droit du travail. Décider si une réponse dit la même chose que la référence, non — et personne de qualifié ne l’a fait.

20,0 %Faux à coup sûrfaux quelle que soit la sévérité de la correction
35,8 %Discutableune correction stricte et une correction indulgente ne sont pas d’accord
44,2 %Juste à coup sûrcompté correct dans les deux lectures

Configuration retenue · 142 questions

Les citations attendues sont justes par construction : chaque question a été écrite à partir de l’article qui y répond, donc la mesure de recherche ne repose sur la mémoire de personne. L’exactitude des réponses est la seule exception. Une première tentative de calibration a donné un kappa de Cohen de 0,489 face à un lecteur non spécialiste — un accord trop faible pour valider quoi que ce soit. Le juge automatique est donc publié comme non validé plutôt que certifié sur un mauvais échantillon.

D’où viennent les questions

Les 142 questions sont construites à partir du corpus : on part d’un article, puis on écrit une question à laquelle il répond. La citation attendue est donc juste par construction, et la mesure de recherche ne dépend de la mémoire de personne. Environ 15 % des questions n’ont volontairement aucune réponse dans le corpus, pour mesurer les refus.

Les réponses ont ensuite été relues par un modèle d’un autre éditeur, qui a signalé 12,7 % des lignes. Les lignes signalées ont été tranchées à la main, avec un échantillon de contrôle tiré des lignes validées — pour vérifier le relecteur autant que les réponses.

Les refus justifiés et les refus à tort sont toujours publiés ensemble : un système qui refuse tout obtiendrait 100 % au premier et 100 % au second. Ici, 100,0 % de refus justifiés pour 8,3 % de refus à tort.

La démo fait tourner le code exact qui a produit ces chiffres, et l’intégration continue échoue si les deux divergent. Chaque exécution de l’évaluation est versionnée dans le dépôt : aucun chiffre ne peut être révisé en silence.

Démonstration technique privée réalisée par FrajTech. Ce site n’est pas un service public, n’émane d’aucune administration et ne constitue pas un conseil juridique. Les textes cités proviennent des données ouvertes DILA (Licence Ouverte) ; vérifiez toujours sur Légifrance avant de vous en servir. Ouvrir Légifrance