IAHDF
Glossaire

MoE (mélange d’experts) : définition simple et exemples

ÉI Équipe IAHDF 12 min de lecture Débutant à intermédiaire

Un modèle MoE (mélange d’experts) n’active qu’une fraction de ses paramètres à chaque jeton. La fiche peut afficher un total énorme et un chiffre « actifs » bien plus petit. Voici ce que cela signifie pour la qualité perçue, la mémoire et vos choix de machine en local.

Définition

Dans un modèle dense, presque tous les paramètres participent à chaque prédiction. Dans un MoE, le réseau contient plusieurs sous-réseaux (experts). À chaque jeton, un mécanisme de routage choisit un petit sous-ensemble. On annonce souvent deux chiffres : le total (capacité stockée) et les actifs (ceux qui calculent vraiment à cet instant). C’est pourquoi une fiche peut écrire quelque chose comme « très grand total / quelques milliards actifs ».

Ce que le mot ne désigne pas : ce n’est pas une preuve que le modèle est « plus intelligent » que tout dense du même nom. Ce n’est pas non plus la quantification : un MoE peut être quantifié comme un dense. Ce n’est pas un format de fichier. Et ce n’est pas un synonyme de « modèle gratuit ». Lisez total, actifs, mémoire conseillée et licence ensemble, plutôt qu’un seul chiffre marketing.

L’intérêt pédagogique du MoE est le compromis : stocker beaucoup de capacité tout en n’activant qu’une partie par jeton. En pratique, la mémoire pour charger le modèle peut rester élevée (il faut souvent garder beaucoup d’experts disponibles), tandis que le coût de calcul par token peut être plus favorable qu’un dense de même total. D’où l’importance de ne pas lire « 180B » comme un 180B dense.

Un exemple du quotidien

Imaginez un grand hôpital avec beaucoup de spécialistes. Pour chaque patient, on n’appelle pas tout le personnel : un triage oriente vers deux ou trois personnes pertinentes. Le bâtiment reste grand (tous les experts existent), mais l’effort du moment est limité. Le MoE fonctionne sur une idée voisine : capacité totale large, activation partielle à chaque pas.

Sur une boutique de modèles, deux fichiers peuvent porter des noms proches. L’un est dense 27B ; l’autre est MoE avec un total bien plus haut et des actifs plus bas. Ce ne sont pas des doublons. Le ressenti vitesse / mémoire / qualité dépendra de votre moteur, de la quantification et de la tâche. Comparez sur vos textes, pas sur le seul plus gros nombre affiché.

Un exemple en Hauts-de-France

À Roubaix, une entreprise textile veut un assistant pour reformuler des fiches produit bilingues. Le responsable informatique voit une fiche MoE « énorme » et croit devoir acheter une carte hors budget. En lisant les paramètres actifs et la mémoire conseillée, l’équipe réalise que le dimensionnement ne se lit pas comme un dense du même total. Elle teste d’abord un modèle compatible avec le matériel déjà en place.

Lors d’un atelier IAHDF à Wattrelos, l’animateur projette deux fiches côte à côte : dense et MoE. Les participants notent total, actifs, quantification, format (GGUF ou tag Ollama). L’exercice n’est pas de couronner un vainqueur : c’est d’éviter l’achat impulsif fondé sur un seul « B » mal compris.

On confond souvent

Première confusion : lire le total comme la charge mémoire d’un dense équivalent. Faux dans les deux sens. Parfois le chargement reste lourd parce que beaucoup d’experts doivent être présents ; parfois le calcul par jeton est plus léger grâce aux actifs limités. Sans essai et sans fiche complète, le slogan « 180B » trompe.

Deuxième confusion : croire que « 6B actifs » signifie « c’est un petit modèle 6B ». Non : c’est la portion active par jeton, pas la taille totale ni une garantie de comportement identique à un dense 6B. Autre mélange : penser que MoE et LoRA sont la même chose. LoRA ajoute un adaptateur entraîné ; MoE est une architecture interne du modèle de base.

En pratique, que faire avec ce mot

Quand une fiche annonce un MoE, cherchez explicitement paramètres totaux et actifs, mémoire conseillée, et compatibilité de votre moteur. Partez d’un ordre de grandeur prudent : plusieurs gigaoctets de mémoire sont souvent en jeu pour des usages confortables, à confirmer sur la fiche et sur votre machine. Testez une tâche réelle courte avant d’investir.

Documentez le tag ou le fichier retenu pour vos collègues. Croisez avec paramètres, VRAM et quantification. Si vous suivez le tutoriel Qwen, lisez la fiche du variant concerné : dense et MoE ne se dimensionnent pas de la même façon. Et rappelez-vous : une architecture élégante n’autorise pas plus de données sensibles.

Termes voisins

Quatre notions proches du MoE
TermeRôle utile
Paramètres totauxCapacité stockée du modèle ; chiffre souvent mis en avant. Voir paramètres.
Paramètres actifsPortion qui calcule à chaque jeton ; clé pour lire un MoE.
Modèle densePresque tous les paramètres participent à chaque pas ; lecture plus simple du « B ».
QuantificationCompresse les poids (experts inclus) pour tenir en mémoire. Voir quantification.

Pour aller plus loin

Pour croiser taille et machine, lisez paramètres, le matériel et l’inférence locale. Les ateliers se trouvent dans l’agenda ; pour rejoindre la communauté, passez par l’inscription.

Questions fréquentes

Que veut dire « 6B actifs » ?

Cela indique qu’à chaque jeton, environ six milliards de paramètres (ordre de grandeur annoncé) participent au calcul, même si le modèle en contient bien plus au total. Ce n’est pas une note de qualité. Ce n’est pas non plus l’équivalent exact d’un dense « 6B » : l’entraînement, le routage et la capacité totale changent le comportement. Lisez toujours actifs et total ensemble, avec la mémoire conseillée. Notez le choix, testez sur vos textes, et faites relire un humain avant tout envoi engageant.

Un MoE est-il toujours plus rapide ?

Non. Le calcul par jeton peut bénéficier d’une activation partielle, mais le chargement, le routage, la quantification et votre matériel pèsent aussi. Un MoE mal dimensionné pour votre carte peut être plus lent qu’un dense plus petit qui tourne confortablement. La seule méthode honnête est de mesurer sur votre machine avec la même tâche. Notez le choix, testez sur vos textes, et faites relire un humain avant tout envoi engageant.

MoE et quantification, comment les lire ensemble ?

La quantification réduit la précision de stockage des poids, experts compris. Un même MoE existe souvent en plusieurs fichiers quantifiés. Choisissez d’abord une taille / architecture compatible, puis une quantification qui charge sans saturer. Ne compensez pas un mauvais choix d’architecture par une compression excessive qui abîme vos tâches sensibles. Notez le choix, testez sur vos textes, et faites relire un humain avant tout envoi engageant. Conservez la version d’outil et du modèle pour pouvoir expliquer la décision à un collègue.

Dois-je préférer un MoE pour débuter en local ?

Pas nécessairement. Pour découvrir, un dense modeste bien documenté reste souvent plus simple à lire et à dépanner. Un MoE devient intéressant quand la fiche est claire (totaux / actifs), que votre moteur le gère bien, et que vos tests montrent un gain sur vos textes. Commencez simple, complexifiez ensuite. Notez le choix, testez sur vos textes, et faites relire un humain avant tout envoi engageant. Conservez la version d’outil et du modèle pour pouvoir expliquer la décision à un collègue.

Le MoE change-t-il quelque chose au RAG ?

Indirectement. Le RAG dépend surtout du chunking, de la recherche hybride et éventuellement d’un reranker. Le MoE change le moteur qui lit le contexte récupéré. Un meilleur routage d’experts n’excuse pas des chunks mal coupés ou des passages hors sujet injectés en masse. Notez le choix, testez sur vos textes, et faites relire un humain avant tout envoi engageant. Conservez la version d’outil et du modèle pour pouvoir expliquer la décision à un collègue.

Cette ressource vous a-t-elle aidé ?

Pour aller plus loin

Glossaire Paramètres (d’un modèle) : définition simple et exemples 12 min · Équipe IAHDF Glossaire Quantification (quantization) : définition simple et exemples 12 min · Équipe IAHDF Glossaire VRAM : définition simple et exemples 12 min · Équipe IAHDF