La recherche hybride combine une recherche par mots-clés et une recherche sémantique (vecteurs). Elle aide quand votre RAG rate des numéros, références et noms propres. Voici ce que le mot désigne, quand l’activer, et comment l’évaluer sans tableaux magiques.
Définition
Une recherche purement vectorielle excelle quand l’utilisateur paraphrase. Elle peut échouer quand la question porte sur un code pièce, un numéro d’article, un acronyme rare ou un nom propre peu fréquent dans l’embedding. La recherche par mots-clés attrape ces jetons exacts, mais rate les synonymes. L’hybride combine les listes ou les scores pour garder le meilleur des deux.
Ce que le mot ne désigne pas : ce n’est pas « deux LLM qui discutent ». Ce n’est pas le reranker (seconde passe de reclassement), même si on enchaîne souvent hybride puis rerank. Ce n’est pas une base documentaire complète. Et ce n’est pas un interrupteur miracle : un chunking qui casse les références limitera encore le rappel.
En pratique pédagogique, l’hybride se comprend mieux avec un contre-exemple : une question reformulée (« comment stopper l’alarme du portique ») versus une question identifiant (« alarme 14B »). La branche sémantique aide la première ; la branche mots-clés aide la seconde. Votre corpus métier mélange presque toujours les deux styles de demande : d’où l’intérêt du signal combiné.
Les outils locaux exposent parfois un poids entre les deux branches. Sans protocole, ce poids devient un curseur magique. Fixez d’abord un jeu de questions oracles (paraphrases et codes), mesurez le rappel du bon passage, puis ajustez. L’honnêteté méthodologique bat la collection de réglages « parce que le tutoriel le disait ».
Un exemple du quotidien
Vous cherchez « la notice de la pompe XJ-204 ». Un moteur sémantique peut ramener d’autres pompes « similaires ». Un moteur mots-clés trouve XJ-204 s’il est indexé tel quel. L’hybride réduit le risque de tomber à côté. C’est le même réflexe qu’une recherche boutique : parfois le nom commercial, parfois la référence fabricant.
Dans les réglages d’un RAG local, « hybrid search » apparaît souvent à côté du top-k. L’activer sans jeu de tests revient à tourner un bouton au hasard. Construisez des questions qui mélangent langage naturel et identifiants. Observez quels documents remontent avant de juger le LLM.
Un exemple en Hauts-de-France
À Dunkerque, une entreprise industrielle documente des procédures avec des codes engins. Les agents demandent au chat « que faire si l’alarme 14B saute sur le portique ». Sans hybride, le système ramène des alarmes voisines. Avec hybride, le bon code apparaît plus souvent dans les candidats. Le métier valide ensuite la réponse : l’outil aide, il ne signe pas la consigne.
À Valenciennes, un service formation combine hybride et reranker sur un corpus de fascicules. L’atelier IAHDF montre qu’une moitié des échecs venait de références coupées au chunking. On corrige d’abord la coupe, puis on active l’hybride. Ordre des leviers > accumulation de curseurs.
On confond souvent
Première confusion : hybride = reranker. Non. L’hybride enrichit/ordonne la récupération initiale ; le reranker reclasse ensuite une shortlist. Deuxième confusion : croire que l’hybride dispense d’un embedding de qualité. Les deux signaux restent utiles ; un embedding médiocre affaiblit la branche sémantique.
Autre mélange : penser que BM25 (ou équivalent) est « dépassé ». Pour les identifiants, il reste précieux. Autre piège : activer l’hybride sur des scans OCR calamiteux : si le code est mal lu, ni mots-clés ni vecteurs ne sauveront. Améliorez d’abord la qualité texte source.
En pratique, que faire avec ce mot
Si vos utilisateurs citent des références, activez l’hybride et testez. Si vos questions sont surtout paraphrasées sur un style homogène, le sémantique seul peut suffire un temps. Mesurez le rappel du bon passage dans le top-k. Ajustez ensuite reranker et nombre de chunks injectés. Documentez la config retenue.
Croisez base vectorielle, chunking et le tutoriel Qwen / Open WebUI selon votre stack. Refusez les promesses de « +X % de précision » sans protocole. Et n’oubliez pas les filtres de métadonnées : retrouver le bon code dans le mauvais service reste un échec métier.
Termes voisins
| Terme | Rôle utile |
|---|---|
| BM25 (et cousins) | Score mots-clés classique, utile pour termes exacts. |
| Recherche vectorielle | Proximité d’embeddings ; forte sur les paraphrases. |
| Reranker | Reclasse une shortlist après récupération. Voir reranker. |
| Chunking | Conditionne ce qui peut être retrouvé exactement. Voir chunking. |
Pour aller plus loin
Pour le pipeline : chunking, base vectorielle, reranker. Ateliers : l’agenda. Communauté : l’inscription.
Questions fréquentes
Pourquoi mon RAG rate les numéros et noms propres ?
Souvent parce que la recherche sémantique seule dilue les jetons rares au profit de documents « voisins ». Une branche mots-clés (hybride) rattrape beaucoup de ces cas, à condition que le texte OCR soit correct et que le chunking n’ait pas coupé la référence. Vérifiez aussi que le document est bien dans la base et non filtré par métadonnées. Testez une requête exacte hors chat pour isoler la couche recherche.
Quand activer la recherche hybride ?
Dès que votre corpus contient des identifiants, codes, noms de dispositifs, articles de loi, références internes. Activez aussi si les utilisateurs mélangent jargon et langage courant. Si vous n’avez que de la prose homogène sans codes, vous pouvez commencer sans, puis activer dès les premiers ratés mesurés. Gardez un jeu de questions de régression. Notez le choix, testez sur vos textes, et faites relire un humain avant tout envoi engageant.
L’hybride rend-il le reranker inutile ?
Non. Ils agissent à des étapes différentes. L’hybride améliore la composition de la liste initiale ; le reranker affine l’ordre et aide à n’injecter que le meilleur. Sur certains corpus, l’un suffit ; sur d’autres, la combinaison gagne. Mesurez plutôt que d’activer toute la stack par principe. Notez le choix, testez sur vos textes, et faites relire un humain avant tout envoi engageant. Conservez la version d’outil et du modèle pour pouvoir expliquer la décision à un collègue.
Cela coûte-t-il plus cher en calcul ?
Un peu plus, en général : deux logiques de score à combiner. Sur un corpus modeste en local, le surcoût est souvent acceptable face au gain de rappel. Sur de très gros index, dimensionnez et mesurez la latence. Méfiez-vous des chiffres absolus non liés à votre volume. L’ordre de grandeur se juge sur votre machine avec votre outil. Si la latence gêne les agents, réduisez le top-k ou n’activez l’hybride que sur les collections riches en identifiants.
Que faire si l’hybride ramène trop de bruit ?
Réduisez le top-k, ajoutez un reranker, renforcez les filtres de métadonnées, et revoyez le chunking des zones bruyantes (annexes, pieds de page). Parfois un terme trop générique domine la branche mots-clés : reformulez les questions types ou boostez certains champs. Itérez avec méthode ; n’empilez pas trois changements d’un coup. Documentez chaque essai pour ne pas perdre le réglage qui fonctionnait la veille. Notez le choix, testez sur vos textes, et faites relire un humain avant tout envoi engageant.
