Intelligence documentaire · Agroécologie

Deux prototypes IA pour questionner le savoir en agroécologie

Posez vos questions en français ou en anglais et obtenez vos réponses tirées des documents du Cirad et de ses partenaires, avec les sources citées.

Deux petits budgets, deux terrains, une même idée.

Vendeuse consultant une tablette dans un marché de fruits
2terrains testés
4 000+documents indexés
100%réponses sourcées
Logo Cirad Logo Aïda Logo eKoal
Deux terrains

Chercher une réponse précise, sans se perdre dans des centaines de rapports.

Ces deux prototypes testent une autre voie : indexer un corpus, puis répondre en citant les extraits exacts dont la réponse est tirée.

Vue aerienne de parcelles agricoles tropicales en mosaique
Terrain 01 — Agroécologie

BOOST-AE

Plateforme collaborative pour la transition agroécologique dans les pays du Sud.

Assistant conversationnel Logo ChatBoosT
Corpus indexé
Plus de 4 000 documents, manuels, fiches techniques, publications, rapports, guides, sur l'agroécologie avec un focus sur la transition agroécologique dans l'océan Indien. Les documents proviennent de la base documentaire Agritrop du Cirad, des partenaires de l'océan Indien, et de plusieurs ONG qui œuvrent sur le terrain.
Sœur régionale
BOOST-OI, pour le Sud-Ouest de l'océan Indien.
« Quels partenaires travaillent sur l'agroforesterie à Madagascar ? » type de requête cible — base partenaires
Voir le ChatBoosT
Agriculteur au bord d'un champ, avec un pulverisateur, illustrant le terrain agroecologie
Terrain 02 — Réduction des pesticides

PRETAG

Approches scientifiques et partenariales pour réduire l'usage des pesticides en agriculture tropicale.

Corpus indexé
Publications scientifiques et rapports rassemblés par l'initiative Pretag (2022–2024).
Accès
Public, sans inscription — chaque réponse cite ses extraits sources.
« Quelles plantes de couverture limitent les bioagresseurs du bananier ? » question type — accès public
Voir pretag.deepermind.ai
Développement

Le partenaire technique

Logo eKoal

Les deux plateformes ont été développées par eKoal, agence réunionnaise spécialisée dans les sites web, applications métier et solutions d'intelligence artificielle sur mesure. eKoal a conçu l'architecture technique de BOOST-AE et accompagné l'intégration de PRETAG, en s'appuyant sur son expertise en recherche sémantique, automatisation et intégration d'API. eKoal développe également DeeperMind, la plateforme de RAG documentaire utilisée par PRETAG. Plus d'informations sur ekoal.re.

Le principe

Comment ça marche

01

Indexationles documents sont découpés puis transformés en vecteurs.

02

Recherchela question est comparée à ces vecteurs pour trouver les bons passages.

03

Réponse sourcéele modèle rédige la réponse à partir de ces extraits, cités à l'appui.

Sous le capot

Le RAG, en détail

Les deux prototypes reposent sur le même principe technique : le RAG (Retrieval-Augmented Generation, ou « génération augmentée par récupération »).

Un modèle de langage seul invente parfois des réponses quand il ne connaît pas la réponse exacte à une question pointue — un phénomène appelé hallucination. Le RAG corrige ce problème en obligeant le modèle à s'appuyer sur des documents réels avant de répondre, plutôt que sur sa seule mémoire d'entraînement.

Concrètement, le processus se déroule en trois temps. D'abord, l'indexation : chaque document (rapport, publication, fiche technique) est découpé en fragments appelés chunks, puis chaque chunk est transformé en un vecteur numérique via la vectorisation (ou embedding), qui capture le sens du texte plutôt que ses mots exacts. Ces vecteurs sont stockés dans une base spécialisée — un moteur comme Elasticsearch ou une base vectorielle dédiée — capable de retrouver rapidement les passages les plus proches d'une question, même si elle est formulée différemment du texte source.

Ensuite vient la recherche sémantique : quand une question arrive, elle est elle-même vectorisée, puis comparée à l'ensemble des chunks indexés par un module appelé retriever, chargé de retrouver les passages les plus pertinents — les nuggets d'information. Des facettes (filtres par type de document, date, thématique, langue…) permettent d'affiner cette recherche avant de la transmettre au modèle.

Enfin, la génération augmentée : le modèle de langage reçoit la question accompagnée des extraits les plus pertinents retrouvés, et rédige sa réponse en s'appuyant uniquement sur ce contenu — avec les sources et citations à l'appui, pour que chaque affirmation puisse être vérifiée dans le document d'origine.

PRETAG s'appuie sur ce principe via DeeperMind, une plateforme de RAG documentaire. Pour un aperçu plus détaillé de cette approche, voir la page deepermind.ai.

Technologies mobilisées

Node.jsElasticsearchLangChainHugging FaceLLMAPIRAG

Quelques définitions

RAG
Retrieval-Augmented Generation — génération de réponses appuyée sur une recherche documentaire préalable, plutôt que sur la seule mémoire du modèle.
LLM
Large Language Model — modèle de langage entraîné sur de grands volumes de texte, capable de comprendre une question et de rédiger une réponse en langage naturel.
Chunk
Fragment de texte issu du découpage d'un document, taillé pour être indexé et retrouvé indépendamment du reste.
Vectorisation / Embedding
Transformation d'un texte en une suite de nombres représentant son sens, pour permettre des comparaisons mathématiques entre contenus.
Recherche sémantique
Recherche fondée sur le sens d'une requête plutôt que sur la présence exacte des mots, grâce aux vecteurs.
Retriever
Module chargé de comparer la question aux chunks indexés et d'en extraire les passages les plus pertinents, avant qu'ils ne soient transmis au modèle.
Elasticsearch
Moteur de recherche et d'indexation open source, souvent utilisé pour stocker et interroger de grands volumes de documents.
Nugget
Extrait précis d'information jugé pertinent pour répondre à une question, isolé au sein d'un document plus large.
Facette
Filtre de recherche (type, date, thématique, source…) permettant d'affiner les résultats avant ou après la recherche sémantique.
Base de connaissances
Ensemble structuré des documents indexés, organisé par projet, équipe ou thématique, sur lequel le système RAG s'appuie.
Prompt augmenté
Question posée au modèle, enrichie automatiquement des extraits de documents jugés pertinents avant d'être envoyée.
Sourcing / Citation
Association de chaque réponse générée aux passages exacts des documents dont elle est tirée, pour permettre la vérification.

Explications inspirées de la présentation de l'approche RAG sur deepermind.ai.

© 2026 — Cirad