Comment c’est mesuré
N’importe quel système de ce type peut avoir l’air de marcher sur trois questions bien choisies. Celui-ci a été mesuré sur 142 questions écrites et annotées à la main, et les résultats gênants sont publiés avec les autres.
Chaque palier ajoute une seule chose
Six versions du même système, chacune ajoutant exactement une capacité à la précédente. L’écart entre deux lignes est donc attribuable à cette capacité, et pas à un paquet de changements. Deux mesures par ligne : ce qu’il retrouve, et ce qu’il retrouve qui ne s’applique plus.
L’article qui tranche est retrouvéDes articles abrogés sont servis au modèle (moins c’est mieux)
La recherche lexicale, ajoutée au palier « hybrid », a fait baisser la performance de 7,5 points. C’est publié tel quel. Un tableau où chaque ligne améliore la précédente est un tableau que personne n’a vraiment mesuré : on y a seulement gardé ce qui arrangeait. Le reclassement a ensuite récupéré cette perte, et davantage.
Le filtre de date est le changement qui compte le plus. Sans lui, 63,3 % des questions remontaient au moins un article abrogé, et le modèle répondait correctement à partir d’un texte qui ne s’applique plus. Aucune mesure d’exactitude ne voit cette erreur : la réponse est bien rédigée et bien sourcée, simplement fausse. Avec le filtre : 0,0 %.
| palier | ce qu’il ajoute | article trouvé | réponses justes | citations | abrogés | € / question |
|---|---|---|---|---|---|---|
| baseline | découpage à taille fixe | 84,2 % | 45,0 % – 76,7 % | 58,7 % | 66,7 % | 0.0016 |
| article | découpage par article | 85,8 % (+1,7) | 46,7 % – 80,8 % | 57,9 % | 67,5 % | 0.0020 |
| hybrid | + recherche lexicale | 78,3 % (−7,5) | 45,8 % – 74,2 % | 58,2 % | 61,7 % | 0.0077 |
| rerank | + reclassement | 87,5 % (+9,2) | 49,2 % – 81,7 % | 59,9 % | 62,5 % | 0.0040 |
| rewrite | + reformulation | 88,3 % (+0,8) | 50,0 % – 81,7 % | 58,2 % | 63,3 % | 0.0042 |
| filtered | + filtre de date et précédence | 90,8 % (+2,5) | 44,2 % – 80,0 % | 69,7 % | 0,0 % | 0.0045 |
Pourquoi l’exactitude est publiée comme une fourchette
Tous les autres chiffres de cette page se vérifient sans connaître le droit du travail. Décider si une réponse dit la même chose que la référence, non — et personne de qualifié ne l’a fait.
Configuration retenue · 142 questions
Les citations attendues sont justes par construction : chaque question a été écrite à partir de l’article qui y répond, donc la mesure de recherche ne repose sur la mémoire de personne. L’exactitude des réponses est la seule exception. Une première tentative de calibration a donné un kappa de Cohen de 0,489 face à un lecteur non spécialiste — un accord trop faible pour valider quoi que ce soit. Le juge automatique est donc publié comme non validé plutôt que certifié sur un mauvais échantillon.
D’où viennent les questions
Les 142 questions sont construites à partir du corpus : on part d’un article, puis on écrit une question à laquelle il répond. La citation attendue est donc juste par construction, et la mesure de recherche ne dépend de la mémoire de personne. Environ 15 % des questions n’ont volontairement aucune réponse dans le corpus, pour mesurer les refus.
Les réponses ont ensuite été relues par un modèle d’un autre éditeur, qui a signalé 12,7 % des lignes. Les lignes signalées ont été tranchées à la main, avec un échantillon de contrôle tiré des lignes validées — pour vérifier le relecteur autant que les réponses.
Les refus justifiés et les refus à tort sont toujours publiés ensemble : un système qui refuse tout obtiendrait 100 % au premier et 100 % au second. Ici, 100,0 % de refus justifiés pour 8,3 % de refus à tort.
La démo fait tourner le code exact qui a produit ces chiffres, et l’intégration continue échoue si les deux divergent. Chaque exécution de l’évaluation est versionnée dans le dépôt : aucun chiffre ne peut être révisé en silence.