La température est un réglage d’échantillonnage qui influence le caractère plus déterministe ou plus exploratoire des réponses d’un modèle. Voici ce qu’elle fait vraiment, ce qu’elle ne répare pas, et comment la choisir selon que vous rédigez un poème ou une procédure.
Définition
Lors de la génération, le modèle propose une distribution sur le prochain token. La température rescale cette distribution avant tirage. Une température basse favorise les continuations « attendues » ; une température plus haute rend les tirages plus variés, parfois plus surprenants, parfois plus incohérents. Les interfaces (Ollama, Open WebUI, LM Studio) exposent souvent ce curseur à côté d’autres paramètres (top-p, etc.).
Ce que le mot ne désigne pas : ce n’est pas un thermomètre de qualité. Ce n’est pas un correcteur de faits. Baisser la température ne transforme pas un modèle mal informé en base documentaire fiable — pour cela, préférez sources et RAG. Ce n’est pas non plus la consigne système : la consigne dit quoi faire ; la température influence comment les tokens sont tirés.
Les échelles exactes et les valeurs « idéales » varient selon les outils et les modèles. Traitez les recommandations comme des points de départ. La seule validation honnête est de comparer deux réglages sur les mêmes prompts et les mêmes critères (fidélité, diversités, refus, style).
Dans une équipe, la température devient un élément de recette au même titre que le modèle et la consigne. Si chacun bouge le curseur librement, vous ne pourrez plus expliquer pourquoi deux brouillons divergent. Des presets nommés (« factuel », « brainstorm ») réduisent le bruit organisationnel autant que le bruit génératif.
Un exemple du quotidien
Imaginez un menu au restaurant. Température basse : vous commandez souvent les plats signature. Température haute : vous essayez plus volontiers des associations inhabituelles — parfois excellentes, parfois ratées. Ni l’une ni l’autre ne garantit que le serveur connaît votre allergie : cela reste une autre couche d’information.
Pour un mail de relance poli, une température trop haute peut produire des formulations bizarres. Pour un brainstorming de slogans, une température trop basse peut coller à des clichés. Le bon réglage suit l’intention : stabilité versus exploration. Notez-le dans vos recettes d’équipe comme une épice, pas comme une vérité universelle.
Un exemple en Hauts-de-France
À Compiègne, une agence de communication locale utilise un modèle local pour des pistes de titres. Elle monte légèrement la température pour la phase d’idéation, puis la redescend pour la phase de reformulation « prête client ». Deux profils sauvegardés dans Open WebUI évitent les débats sans fin à chaque brief.
À Calais, un service qualité rédige des check-lists. Là, température basse et consignes strictes : on veut de la régularité, pas de la fantaisie. L’atelier IAHDF montre le même modèle, deux températures, dix prompts identiques : les participants voient la variance. On rappelle aussi le matériel : ce réglage est gratuit, contrairement à une carte plus grosse.
On confond souvent
Première confusion : température basse = toujours plus vrai. Non. Le modèle peut être déterministement faux. Deuxième confusion : température haute = toujours plus intelligent. Non. Vous augmentez souvent la diversité, pas la compétence. Autre mélange : régler la température pour « fixer » un RAG cassé. Si le mauvais chunk est injecté, changez chunking / hybride / reranker.
On confond aussi température et top-p (nucleus sampling). Ce sont des leviers voisins sur l’échantillonnage, mais pas identiques. Toucher les deux en même temps sans méthode rend les tests illisibles. Changez un paramètre à la fois quand vous calibrez une recette d’équipe.
En pratique, que faire avec ce mot
Définissez deux ou trois profils : factuel / rédaction soignée / créatif. Pour chaque profil, fixez une température de départ recommandée par votre outil, puis validez sur dix prompts réels. Documentez. Interdisez les réglages improvisés sur les usages à risque (juridique, santé, sécurité) sans relecture humaine.
Croisez avec consigne système, Ollama et Open WebUI. Si vous suivez le tutoriel Qwen, gardez la température stable pendant que vous réglez le RAG : sinon vous ne saurez plus quel levier a aidé. Et souvenez-vous : aucun curseur n’autorise à publier sans vérifier.
Termes voisins
- Top-p
- Autre paramètre d’échantillonnage qui limite l’ensemble des tokens candidats selon leur masse de probabilité.
- Consigne système
- Instructions durables sur le rôle et les règles du modèle. Voir consigne système.
- Hallucination
- Affirmation incorrecte présentée avec assurance ; la température peut l’influencer sans la supprimer.
- Seed
- Dans certains outils, fixe le tirage pour reproduire une génération ; utile pour des tests comparatifs.
Pour aller plus loin
Pour les réglages d’interface : Ollama, Open WebUI, consigne système. Ateliers : l’agenda. Communauté : l’inscription.
Questions fréquentes
À quoi sert la température ?
À influencer le tirage des tokens : plus bas, réponses souvent plus stables et répétables ; plus haut, plus de variété et parfois plus d’écarts. Elle sert à adapter le comportement à la tâche (procédure versus brainstorming). Elle ne remplace pas des sources fiables. Elle ne lit pas vos PDF à votre place. Calibrez-la avec les mêmes prompts avant/après pour juger utilement. Notez le choix, testez sur vos textes, et faites relire un humain avant tout envoi engageant.
Quelle valeur choisir ?
Il n’existe pas de valeur universelle honnête pour tous les modèles et tous les outils. Beaucoup d’interfaces proposent un défaut raisonnable pour le chat général. Pour du factuel strict, partez plutôt bas ; pour de la divergence créative, montez un peu, puis observez. Gardez des profils nommés plutôt qu’un curseur bougé à chaque message. Validez sur vos textes, pas sur une capture de réseau social. Notez le choix, testez sur vos textes, et faites relire un humain avant tout envoi engageant.
Pourquoi ma réponse change si je relance à température égale ?
Parce que l’échantillonnage reste aléatoire tant que la température n’est pas nulle (ou qu’un mode déterministe / seed n’est pas activé). Des différences mineures de prompt, de contexte ou de backend peuvent aussi jouer. Pour des tests scientifiques maison, fixez seed si l’outil le permet, et comparez des lots, pas une seule génération. Notez le choix, testez sur vos textes, et faites relire un humain avant tout envoi engageant. Conservez la version d’outil et du modèle pour pouvoir expliquer la décision à un collègue.
La température corrige-t-elle les hallucinations ?
Elle peut réduire certaines digressions hasardeuses quand on la baisse, mais elle ne crée pas de connaissance. Un modèle peut répéter une erreur avec une température très basse. Pour les faits, appuyez-vous sur documents (chunking, hybride, reranker) et sur la vérification humaine. Traitez la température comme un levier de style de tirage, pas comme un antivirus à hallucinations. Notez le choix, testez sur vos textes, et faites relire un humain avant tout envoi engageant.
Dois-je la même température pour toute l’équipe ?
Pour un usage partagé (réponses types, conformité), oui : figez un profil. Pour des ateliers créatifs, autorisez un second profil clairement étiqueté. L’important est la traçabilité : savoir quel réglage a produit quel brouillon. Dans Open WebUI, des modèles personnalisés ou presets aident à éviter le chaos des curseurs individuels. Notez le choix, testez sur vos textes, et faites relire un humain avant tout envoi engageant. Conservez la version d’outil et du modèle pour pouvoir expliquer la décision à un collègue.
