IAHDF
Glossaire

Distillation : définition simple et exemples

ÉI Équipe IAHDF 12 min de lecture Mis à jour le 27 septembre 2026 Débutant à intermédiaire

La distillation transfère une partie des capacités d’un grand modèle (enseignant) vers un modèle plus petit (élève). Ce n’est pas la même chose que compresser les bits. Voici la définition utile pour choisir un modèle local sans confondre les étiquettes, ni croire qu’un petit fichier égale automatiquement le géant.

Définition

En apprentissage automatique, la distillation consiste souvent à faire produire des réponses (ou des distributions de probabilités) par un modèle enseignant, puis à entraîner un modèle élève pour se rapprocher de ces sorties, parfois en plus de données classiques. L’élève apprend ainsi des régularités « compressées » dans un réseau plus léger. Le résultat : un modèle avec moins de paramètres, plus facile à déployer, qui conserve une partie des aptitudes utiles.

Ce que le mot ne désigne pas : ce n’est pas réduire le nombre de bits des poids d’un modèle déjà entraîné (c’est la quantification). Ce n’est pas non plus un simple téléchargement d’un fichier plus petit au hasard. La distillation est une étape d’entraînement / transfert. Sur une fiche grand public, vous ne voyez pas toujours le détail ; vous voyez le résultat : une variante « small » réputée proche d’une grande sur certaines tâches.

Les éditeurs distillent pour des raisons concrètes : coût d’inférence, latence, déploiement sur PC ou téléphone. La qualité dépend du couple enseignant/élève, des données, et des tâches mesurées. Un petit modèle distillé peut battre un petit modèle entraîné naïvement, sans égaler le géant sur tout. Lisez les évaluations avec prudence et testez sur vos textes.

Un exemple du quotidien

Analogie de cuisine : une sauce longue mijotée (grand modèle) est réduite en un concentré (petit modèle) qui garde une partie du goût, pas toute la complexité du plat d’origine. Vous gagnez en praticité pour le quotidien. Pour un banquet exigeant, vous revenez parfois à la grande cuisine. La distillation vise ce concentré utile, pas un clone parfait.

Dans une boutique de modèles, deux fichiers « 8B » ne se valent pas forcément : l’un peut être une base classique, l’autre une version distillée depuis une famille plus large, avec un entraînement différent. Le chiffre de paramètres ne raconte pas toute l’histoire. D’où l’intérêt de lire la fiche (méthode, licence, tâches cibles) avant de juger au seul label marketing.

Un exemple en Hauts-de-France

À Abbeville, une librairie indépendante veut un assistant local pour proposer des formulations de chroniques et des résumés de 4e de couverture, sur un PC de bureau modeste. Un modèle géant refuse de charger. Une variante plus petite, souvent issue de stratégies de distillation côté éditeur, tient en mémoire et reste assez fine pour le style. La libraire compare deux fichiers sur les mêmes textes : clarté, inventions, ton.

À Péronne, une association culturelle anime un atelier « choisir un modèle qui tient ». On oppose quantification (même modèle, moins de bits) et distillation (autre modèle, plus petit, entraîné pour imiter). Les participants retiennent une règle simple : deux leviers différents pour alléger. Croiser avec le matériel évite d’acheter une carte « pour compenser » un mauvais choix de fichier.

On confond souvent

Première confusion : distillation = quantification. Non. La quantification change l’encodage numérique des poids d’un modèle donné. La distillation produit (ou affine) un autre modèle, plus petit, qui imite un enseignant. On peut ensuite quantifier un modèle distillé : les deux techniques se combinent, mais ne se confondent pas.

Deuxième confusion : croire qu’un modèle distillé est « aussi bon » que l’enseignant sur tout. En pratique, on observe des écarts selon les tâches. Autre mélange : penser que distillation anonymise vos données d’usage. Non. C’est une méthode d’entraînement côté éditeur (ou labo), pas une protection de ce que vous collez ensuite dans le chat.

En pratique, que faire avec ce mot

Quand une fiche annonce un petit modèle « proche du grand », cherchez si la distillation (ou une méthode voisine) est mentionnée, quelles tâches sont revendiquées, et quelle licence s’applique. Testez sur vos cas : mails, résumés, Q/R. Si le petit modèle suffit, gardez-le : vous gagnerez en confort d’inférence locale.

Pour une TPE, la distillation vous intéresse surtout comme résultat : des modèles compacts utiles. Vous n’avez pas besoin de distiller vous-même au début. Concentrez-vous sur le choix, la quantification, et la mesure. Croisez paramètres, quantification et GGUF. Documentez le fichier retenu pour l’équipe.

Termes voisins

Quantification
Compression des bits des poids ; distincte de la distillation. Voir quantification.
Paramètres
Taille du modèle élève vs enseignant. Voir paramètres.
Fine-tuning
Adaptation à une tâche ou un style ; peut coexister avec la distillation.
Enseignant / élève
Vocabulaire courant : grand modèle guide, petit modèle apprend à imiter.

Pour aller plus loin

Pour alléger encore, lisez la quantification et GGUF. Pour déployer chez vous : inférence locale. Agenda IAHDF : l’agenda. Inscription : l’inscription.

Questions fréquentes

Comment fait-on de petits modèles performants ?

Plusieurs leviers existent : entraîner efficacement dès le départ, distiller depuis un grand modèle, spécialiser par fine-tuning, puis quantifier pour le déploiement. La distillation est l’un des leviers les plus cités pour transférer des capacités vers un réseau plus léger. En tant qu’utilisateur, vous choisissez surtout le résultat publié ; les labs combinent souvent plusieurs méthodes. Testez toujours sur vos tâches plutôt que de croire un classement unique. Notez le choix, testez sur vos textes, et faites relire un humain avant tout envoi engageant.

Puis-je distiller un modèle moi-même ?

Techniquement, oui dans un cadre recherche ou pro avec données, GPU, et compétences. Pour une TPE ou un particulier débutant, ce n’est rarement le premier geste utile. Préférez des modèles déjà publiés, adaptés à votre machine. La distillation maison demande du temps, de l’énergie, et une lecture attentive des licences des modèles enseignants et des données. Notez le choix, testez sur vos textes, et faites relire un humain avant tout envoi engageant.

Un modèle distillé reste-t-il open weights ?

Cela dépend de la licence du modèle publié et de celle de l’enseignant. Open weights n’est pas automatique. Lisez la fiche sur Hugging Face ou chez l’éditeur. Certaines conditions limitent l’usage commercial ou la redistribution. La méthode d’entraînement (distillation) ne dit pas à elle seule ce que vous avez le droit de faire. Notez le choix, testez sur vos textes, et faites relire un humain avant tout envoi engageant. Conservez la version d’outil et du modèle pour pouvoir expliquer la décision à un collègue.

Distillation ou quantification : que choisir d’abord ?

Ce ne sont pas des alternatives exclusives. En usage, vous choisissez d’abord une famille et une taille de paramètres raisonnable (parfois déjà distillée), puis une quantification compatible avec votre VRAM. Si un fichier ne tient pas, descendez en taille ou quantifiez plus fort. La distillation est souvent déjà « cuite » dans le modèle que vous téléchargez. Notez le choix, testez sur vos textes, et faites relire un humain avant tout envoi engageant.

La distillation efface-t-elle les biais du grand modèle ?

Pas automatiquement. L’élève imite une partie du comportement de l’enseignant, y compris des défauts possibles. Des filtres et des données d’alignement peuvent modifier le résultat, mais ce n’est pas une purge magique. Gardez une relecture critique, surtout sur des sujets sensibles ou des décisions engageantes pour votre structure. Notez le choix, testez sur vos textes, et faites relire un humain avant tout envoi engageant. Conservez la version d’outil et du modèle pour pouvoir expliquer la décision à un collègue.

Cette ressource vous a-t-elle aidé ?

Pour aller plus loin

Glossaire Quantification (quantization) : définition simple et exemples 12 min · Équipe IAHDF Glossaire Paramètres (d’un modèle) : définition simple et exemples 12 min · Équipe IAHDF Glossaire Inférence locale : définition simple et exemples 12 min · Équipe IAHDF