Petit pense-bête : évaluer un pipeline RAG
- RAG
- Évaluation
Dans l’ordre où elles ont le plus de chances de révéler un problème :
- La récupération, avant la génération. Sur un échantillon de questions, quelle proportion ramène au moins un document réellement pertinent ? Sans ce chiffre, impossible de savoir si un mauvais résultat vient du retriever ou du modèle.
- Les questions hors périmètre. Que répond le système quand la bonne réponse n’est pas dans le corpus ? C’est souvent le cas le plus révélateur, et le plus négligé.
- La cohérence dans le temps. La même question, posée deux fois, donne-t-elle la même réponse ? Si non, ce n’est pas forcément un bug — mais il faut le savoir avant que quelqu’un d’autre ne le découvre.