RAG & attribution des sources : trouver, et prouver.
Au challenge RAG d’EvalLLM 2026, Kairntech se classe 1ᵉʳ en performance brute sur l’attribution des sources et dépasse la médiane des participants sur toutes les métriques — sur un corpus fermé de près de 374 documents du domaine de la défense et des drones.
Répondre juste. Et citer la source exacte.
Le RAG (Retrieval‑Augmented Generation) permet à une IA de répondre à une question complexe en s’appuyant sur des milliers de pages. Le vrai défi n’est pas seulement de bien répondre : c’est de citer précisément le document et la page d’où provient chaque information — pour que la réponse soit vérifiable et digne de confiance.
Cette édition portait sur un corpus du domaine de la défense et des drones : bulletins de veille, rapports parlementaires, fiches techniques, thèses, doctrine et documents en source ouverte.
Indexation page par page, recherche hybride BGE‑M3 (dense + lexical fusionnés par RRF), décomposition des requêtes et orchestration n8n.
Un même socle, deux épreuves.
Recherche & génération
À partir d’une question, retrouver les pages utiles du corpus puis rédiger une réponse complète et fidèle. Les questions composites sont décomposées en sous‑requêtes pour mieux couvrir chaque facette.
Attribution des sources
Rattacher chaque phrase d’une réponse à ses pages sources — et signaler celles qui n’en ont pas. Nous comparons une méthode lexicale frugale (sans IA) à une approche par LLM.
De la question à la réponse sourcée.
Décomposition de la question
Une question composite est scindée en 2 à 4 sous‑requêtes ciblées, une par sous‑thème.
Recherche hybride
Chaque sous‑requête interroge l’index BGE‑M3 (sémantique + lexical), fusionné par RRF.
Génération factuelle
La réponse est produite à partir des pages retrouvées, dans la langue de la question, sans invention.
Attribution des sources
Chaque phrase est rattachée à sa (ses) page(s) d’origine — ou signalée comme non sourcée.
Au‑dessus de la médiane, sur toute la ligne.
En recherche & génération, nos trois runs dépassent la médiane des participants sur toutes les métriques — l’écart le plus net portant sur la qualité de réponse jugée par un jury LLM.
En attribution des sources, notre meilleur run dépasse également la médiane, l’approche par LLM se révélant la plus précise.
| Tâche 1 — métrique | Kairntech | Médiane |
|---|---|---|
| Qualité de réponse (jury LLM) | 0,84 | 0,59 |
| Rappel @10 | 0,60 | 0,51 |
| NDCG @10 | 0,52 | 0,44 |
| Tâche 2 — attribution | Kairntech | Médiane |
|---|---|---|
| F1 (meilleur run, par LLM) | 0,69 | 0,60 |
Résultats officiels préliminaires communiqués par l’organisation. Attribution des sources : 1ᵉʳ en performance brute (sur 20 systèmes) ; le classement final applique ensuite des critères de frugalité.
Performant — et sobre
Pour l’attribution, nous avons d’abord mesuré ce qu’une méthode lexicale sans IA permet : elle produit une attribution à zéro inférence LLM, avant de recourir au modèle uniquement là où il apporte un gain réel. Mesurer le coût en même temps que la qualité fait partie de notre approche : une configuration peut être performante sans être sobre. La frugalité (open‑source, empreinte CO₂, ressources de calcul) est un critère que nous prenons au sérieux.
Recevez nos ressources RAG & attribution
Notre poster et notre article détaillé du challenge RAG d’EvalLLM 2026 : corpus défense, méthode, résultats et empreinte carbone. Indiquez votre email — on vous envoie le tout.
La même exigence, au service de vos documents.
Réponses sourcées, sans hallucination, en toute souveraineté — la traçabilité au cœur de votre RAG.