EvalLLM 2026 · Challenge RAG 🇫🇷 Domaine défense & drones

RAG & attribution des sources : trouver, et prouver.

Au challenge RAG d’EvalLLM 2026, Kairntech se classe 1ᵉʳ en performance brute sur l’attribution des sources et dépasse la médiane des participants sur toutes les métriques — sur un corpus fermé de près de 374 documents du domaine de la défense et des drones.

Organisé par l’AMIAD · atelier EvalLLM 2026 & GT RAG du GdR TAL (CORIA‑TALN, Nantes, 29 juin 2026)
1ᵉʳ
attribution des sources — performance brute
0,84
qualité de réponse (jury LLM) — médiane 0,59
2
tâches : recherche & génération, puis attribution
~374
documents — corpus défense & drones
La tâche

Répondre juste. Et citer la source exacte.

Le RAG (Retrieval‑Augmented Generation) permet à une IA de répondre à une question complexe en s’appuyant sur des milliers de pages. Le vrai défi n’est pas seulement de bien répondre : c’est de citer précisément le document et la page d’où provient chaque information — pour que la réponse soit vérifiable et digne de confiance.

Cette édition portait sur un corpus du domaine de la défense et des drones : bulletins de veille, rapports parlementaires, fiches techniques, thèses, doctrine et documents en source ouverte.

Techniquement

Indexation page par page, recherche hybride BGE‑M3 (dense + lexical fusionnés par RRF), décomposition des requêtes et orchestration n8n.

« Quelles sont les spécifications techniques du système ? »
D’après le corpus, la portée nominale est de X km et la charge utile de Y kg. [1]
Source citée [1]
fiche_technique.pdf
document + numéro de page physique · granularité d’évaluation : la page
Deux tâches

Un même socle, deux épreuves.

Tâche 01 · 595 questions

Recherche & génération

À partir d’une question, retrouver les pages utiles du corpus puis rédiger une réponse complète et fidèle. Les questions composites sont décomposées en sous‑requêtes pour mieux couvrir chaque facette.

Évaluée par MRR, rappel, NDCG, Top‑1 et un jury LLM.
Tâche 02 · 260 questions

Attribution des sources

Rattacher chaque phrase d’une réponse à ses pages sources — et signaler celles qui n’en ont pas. Nous comparons une méthode lexicale frugale (sans IA) à une approche par LLM.

Évaluée par précision, rappel et F1 de l’attribution.
Comment ça marche

De la question à la réponse sourcée.

1

Décomposition de la question

Une question composite est scindée en 2 à 4 sous‑requêtes ciblées, une par sous‑thème.

2

Recherche hybride

Chaque sous‑requête interroge l’index BGE‑M3 (sémantique + lexical), fusionné par RRF.

3

Génération factuelle

La réponse est produite à partir des pages retrouvées, dans la langue de la question, sans invention.

4

Attribution des sources

Chaque phrase est rattachée à sa (ses) page(s) d’origine — ou signalée comme non sourcée.

Les résultats

Au‑dessus de la médiane, sur toute la ligne.

En recherche & génération, nos trois runs dépassent la médiane des participants sur toutes les métriques — l’écart le plus net portant sur la qualité de réponse jugée par un jury LLM.

En attribution des sources, notre meilleur run dépasse également la médiane, l’approche par LLM se révélant la plus précise.

Tâche 1 — métriqueKairntechMédiane
Qualité de réponse (jury LLM)0,840,59
Rappel @100,600,51
NDCG @100,520,44
Tâche 2 — attributionKairntechMédiane
F1 (meilleur run, par LLM)0,690,60

Résultats officiels préliminaires communiqués par l’organisation. Attribution des sources : 1ᵉʳ en performance brute (sur 20 systèmes) ; le classement final applique ensuite des critères de frugalité.

Performant — et sobre

Pour l’attribution, nous avons d’abord mesuré ce qu’une méthode lexicale sans IA permet : elle produit une attribution à zéro inférence LLM, avant de recourir au modèle uniquement là où il apporte un gain réel. Mesurer le coût en même temps que la qualité fait partie de notre approche : une configuration peut être performante sans être sobre. La frugalité (open‑source, empreinte CO₂, ressources de calcul) est un critère que nous prenons au sérieux.

Poster + Article

Recevez nos ressources RAG & attribution

Notre poster et notre article détaillé du challenge RAG d’EvalLLM 2026 : corpus défense, méthode, résultats et empreinte carbone. Indiquez votre email — on vous envoie le tout.

Données 100% sécurisées
Gratuit, sans engagement
Accès immédiat

La même exigence, au service de vos documents.

Réponses sourcées, sans hallucination, en toute souveraineté — la traçabilité au cœur de votre RAG.

© Kairntech · EvalLLM 2026 — Challenge RAG · AMIAD, Ministère des Armées