IAHDF
Glossaire

Quantification (quantization) : définition simple et exemples

ÉI Équipe IAHDF 12 min de lecture Mis à jour le 27 septembre 2026 Débutant à intermédiaire

La quantification réduit la précision des nombres d’un modèle pour qu’il tienne en mémoire. Voici ce que signifie Q4 ou Q8, ce que ça change vraiment, et comment éviter les mauvaises surprises sur un PC de bureau.

Définition

En apprentissage automatique, les paramètres d’un modèle sont des nombres. En précision « pleine », ces nombres occupent beaucoup de place. La quantification (quantization) remplace ces valeurs par des représentations plus compactes : moins de bits par paramètre. Le fichier devient plus léger ; le chargement demande souvent moins de VRAM ou de RAM. On parle alors de modèles « Q4 », « Q5 », « Q8 », ou d’autres schémas selon l’outil.

Ce que le mot ne désigne pas : ce n’est ni un nouvel entraînement complet, ni une preuve que le modèle « oublie » volontairement des sujets, ni un format magique unique. Ce n’est pas non plus la même chose que le GGUF : le GGUF est un format de fichier ; à l’intérieur, on trouve souvent une quantification particulière. La quantification décrit comment les nombres sont encodés. Le format décrit comment le fichier est emballé pour un moteur donné.

Un exemple du quotidien

Imaginez une photo haute résolution trop lourde pour votre téléphone. Vous enregistrez une version compressée : l’image reste lisible, les détails fins s’adoucissent. La quantification joue un rôle voisin pour un modèle : on garde l’essentiel du comportement, on accepte une perte de précision pour tenir dans un disque et une carte graphique raisonnables. Comme pour une photo, « trop compressé » finit par nuire : réponses plus plates, réflexion plus fragile, erreurs plus fréquentes.

Dans un logiciel comme LM Studio ou Ollama, vous choisissez souvent une variante du même modèle. La fiche indique une quantification. Vous ne changez pas forcément de « personnalité » commerciale ; vous changez le compromis technique. Si deux fichiers portent le même nom de famille mais des étiquettes Q différentes, ce n’est pas un doublon inutile : ce sont des tailles et des qualités potentielles différentes.

Un exemple en Hauts-de-France

À Valenciennes, un artisan en menuiserie veut un assistant local pour reformuler des devis, sans envoyer les plans clients dans le cloud. Son PC de bureau a une carte graphique modeste. Un modèle trop volumineux refuse de charger. En choisissant une quantification plus agressive — souvent un fichier Q4 plutôt qu’un Q8 — le même modèle de base peut tenir. La qualité de rédaction reste utile pour des phrases courtes ; pour un raisonnement long sur un cahier des charges, il faudra peut-être un modèle plus petit en paramètres, mieux quantifié, plutôt qu’un géant mal compressé.

Dans un atelier IAHDF ou une Maison de l’IA, l’exercice pédagogique est souvent le même : ouvrir la fiche du modèle, lire la quantification, croiser avec le matériel disponible, puis tester deux fichiers sur la même tâche. On compare la fluidité et la justesse, sans inventer un score magique. L’objectif n’est pas « le meilleur fichier du monde » : c’est le fichier qui tient chez vous et qui reste assez fiable pour votre usage.

On confond souvent

Première confusion fréquente : croire que « Q4 » est toujours moins bon que « Q8 » de façon absolue. En pratique, le résultat dépend du modèle, de la tâche et de la machine. Un Q4 bien choisi sur un modèle adapté peut battre un Q8 d’un modèle trop gros pour votre carte, simplement parce que le Q8 ne charge pas correctement ou swap trop. La quantification se lit avec la taille en paramètres et la mémoire disponible, pas comme une note scolaire isolée.

Deuxième confusion : confondre quantification et distillation. La distillation entraîne souvent un modèle plus petit à imiter un plus grand. La quantification compresse les nombres d’un modèle déjà existant. Autre mélange : penser que quantifier anonymise vos données. Non. Réduire la précision des poids n’efface pas les documents que vous collez ensuite dans le chat. La confidentialité dépend de où tourne l’inférence et de ce que vous collez, pas du seul label Q4.

En pratique, que faire avec ce mot

Quand vous choisissez un outil ou un modèle, lisez d’abord la fiche : taille approximative du fichier, quantification, mémoire conseillée. Partez d’un ordre de grandeur prudent : beaucoup de modèles locaux confortables tiennent souvent dans plusieurs gigaoctets, à vérifier sur la fiche et sur votre machine. Testez une tâche réelle courte — reformuler un courriel, résumer une page — plutôt qu’un monologue technique. Si le modèle rame ou hallucine trop, changez de quantification ou descendez en taille de paramètres avant d’acheter du matériel.

Gardez une règle simple pour une TPE ou une association : un fichier qui charge vite et répond correctement sur vos textes vaut mieux qu’un fichier « premium » qui sature la machine. Notez la quantification retenue dans votre documentation interne. Pour un parcours guidé, croisez avec GGUF, Ollama et le tutoriel Qwen. Et souvenez-vous : la quantification ne remplace ni la relecture humaine, ni une bonne consigne système.

Termes voisins

VRAM
Mémoire de la carte graphique, souvent le goulot pour charger un modèle local. Voir VRAM.
GGUF
Format de fichier courant pour llama.cpp, Ollama et LM Studio, souvent livré avec une quantification. Voir GGUF.
Paramètres
Taille « 7B », « 27B » : volume de poids du modèle, distinct de la quantification. Voir paramètres.
Distillation
Autre façon d’obtenir un modèle plus léger, par transfert de connaissances, pas par simple compression des bits. Voir distillation.

Pour aller plus loin

Pour croiser matériel et modèles, lisez le matériel et l’inférence locale. Les ateliers et rencontres se trouvent dans l’agenda ; pour rejoindre la communauté IAHDF, passez par l’inscription.

Questions fréquentes

C’est quoi Q4_K_M ?

C’est une étiquette de quantification fréquente sur les fichiers GGUF. Le « Q4 » indique une précision réduite (autour de 4 bits par poids, selon le schéma). Les lettres suivantes décrivent une variante du schéma (méthode et groupement). En pratique, lisez-le comme « version compressée de ce modèle, plutôt légère ». Comparez toujours avec la taille du fichier et la mémoire conseillée sur la fiche, plutôt que de mémoriser la lettre comme une note absolue.

La quantification détériore-t-elle toujours la qualité ?

Elle introduit un compromis : moins de précision numérique, parfois un peu moins de finesse. Mais « toujours pire » est trompeur. Un modèle trop gros pour votre machine, mal servi, donnera de moins bons résultats qu’un modèle un peu plus compressé qui tourne correctement. Sur des tâches simples (reformulation, plan, résumé), l’écart peut rester acceptable. Sur des tâches exigeantes, testez deux quantifications côte à côte avec les mêmes consignes.

Dois-je toujours prendre le fichier le moins compressé ?

Non. Le fichier le moins compressé est souvent le plus lourd. S’il ne tient pas en mémoire, ou s’il force un échange lent avec le disque, vous perdrez en confort et parfois en qualité perçue. Commencez par une quantification courante compatible avec votre machine, puis montez seulement si vous constatez un gain clair sur vos tâches. Documentez le choix pour vos collègues. Notez le choix, testez sur vos textes, et faites relire un humain avant tout envoi engageant.

Quantification et open weights, c’est lié ?

Souvent oui dans la pratique locale : les modèles à poids ouverts sont redistribués en plusieurs fichiers quantifiés. Mais ce ne sont pas des synonymes. Open weights parle de l’accès aux poids et de la licence. La quantification parle de la précision de stockage. Un modèle fermé cloud peut aussi être quantifié côté serveur, sans que vous le voyiez. Notez le choix, testez sur vos textes, et faites relire un humain avant tout envoi engageant.

Comment choisir pour un premier essai en local ?

Repérez d’abord votre mémoire GPU ou RAM, puis un modèle de taille raisonnable déjà recommandé pour débuter, puis une quantification fréquente (souvent un Q4 ou équivalent selon l’écosystème). Lancez une tâche courte et réelle. Si c’est fluide et utile, gardez. Si c’est trop lent ou trop fragile, changez de taille ou de quantification avant d’investir. Les tutoriels Ollama et LM Studio montrent le geste concret. Notez le choix, testez sur vos textes, et faites relire un humain avant tout envoi engageant.

Cette ressource vous a-t-elle aidé ?

Pour aller plus loin

Glossaire VRAM : définition simple et exemples 12 min · Équipe IAHDF Glossaire GGUF : définition simple et exemples 12 min · Équipe IAHDF Guide pratique Quel matériel pour faire tourner une IA en local en 2026 ? (GPU, Mac, mini-PC) 18 min · Équipe IAHDF