La VRAM est la mémoire de la carte graphique. Pour une IA locale, elle décide souvent si un modèle charge ou non. Voici ce que ça veut dire, sans promesse de Go « exacts » inventés.
Définition
La VRAM est une mémoire rapide située sur (ou associée à) le processeur graphique (GPU). Elle sert d’ordinaire à afficher des images ; en calcul accéléré, elle sert aussi à garder les tensors du modèle pendant l’exécution. Quand vous lancez un LLM en local, une partie — parfois l’essentiel — des paramètres doit tenir dans cette mémoire pour rester fluide. Si ça ne tient pas, le système peut refuser, ralentir fortement, ou basculer une partie du modèle vers la RAM CPU, au prix de la vitesse.
Ce que le mot ne désigne pas : la VRAM n’est pas « l’intelligence » du modèle, ni la taille disque du fichier téléchargé, ni automatiquement toute la mémoire de votre PC. Un ordinateur peut avoir beaucoup de RAM système et peu de VRAM. Inversement, une machine portable peut afficher beaucoup de RAM unifiée (cas fréquents sur certains Mac) sans parler de VRAM discrète classique. Lisez la fiche constructeur et le guide matériel plutôt qu’un slogan forum.
Un exemple du quotidien
Pensez à un atelier avec un plan de travail limité. Vous pouvez y poser un grand meuble ou plusieurs petits outils, pas tout en même temps. La VRAM joue ce rôle de plan de travail pour le GPU : le modèle, le contexte de conversation, parfois le traitement d’image, se disputent la place. Si vous ouvrez un modèle trop grand, il n’y a plus de place pour travailler confortablement. Réduire la quantification ou choisir un modèle plus petit en paramètres, c’est choisir un meuble qui rentre.
Dans un jeu vidéo, une texture trop lourde fait chuter le confort. En IA locale, un contexte trop long ou un modèle trop gros produit le même genre de gêne : lenteur, plantages, ou réponses qui arrivent au compte-gouttes. Le ressenti « mon IA est lente » vient souvent d’un manque de mémoire GPU ou d’un mauvais dimensionnement, pas d’une panne mystérieuse.
Un exemple en Hauts-de-France
À Amiens, une médiathèque équipe un poste pour des ateliers « essayer une IA locale ». Le PC a une carte d’entrée de gamme. L’animateur choisit un modèle compact, bien quantifié, plutôt qu’un modèle « 70B » qui ne tiendra jamais. Les usagers testent la reformulation d’un tract associatif. La démonstration réussit parce que la VRAM disponible a été prise au sérieux dès le choix du fichier, pas parce qu’on a promis un ChatGPT géant sur une machine de bureau classique.
Dans une TPE de textile à Tourcoing, le dirigeant rêve d’un assistant sur les fiches techniques. Avant d’acheter une carte, l’équipe liste les tâches (résumer, reformuler, chercher dans des PDF via un petit RAG). Elle croise besoins et matériel : parfois un abonnement cloud pour les pics, et un petit modèle local pour les textes non sensibles. La VRAM devient un critère d’achat, au même titre que le silence du boîtier dans un open space.
On confond souvent
Première confusion : confondre VRAM et RAM. La RAM est la mémoire système ; la VRAM est celle du GPU. Un modèle peut « tenir en RAM » en mode CPU, mais souvent beaucoup plus lentement. Dire « j’ai 32 Go » sans préciser de quoi peut mener à télécharger un fichier trop ambitieux pour la carte. Deuxième effet de cette confusion : croire qu’ajouter de la RAM système suffit toujours. Parfois oui pour certains moteurs ; souvent, pour une accélération GPU franche, c’est la VRAM qui compte.
Deuxième confusion : croire qu’il existe un chiffre unique « il faut X Go de VRAM pour l’IA ». Il n’y a pas de seuil universel honnête. Cela dépend de la taille en paramètres, de la quantification, du contexte, des couches offloadées, et du moteur (Ollama, llama.cpp, etc.). On peut donner un ordre de grandeur prudent — souvent plusieurs gigaoctets pour des modèles grand public confortables — mais la source de vérité reste la fiche du modèle et un essai sur votre machine.
En pratique, que faire avec ce mot
Avant de choisir un modèle, notez la VRAM (ou la mémoire unifiée) annoncée par votre machine. Lisez la fiche du modèle : mémoire conseillée, quantification, taille fichier. Partez d’un modèle modeste, mesurez le confort, puis montez. Si vous hésitez entre deux cartes, demandez-vous d’abord quelles tâches vous ferez vraiment : chat court, documents, image, multi-utilisateurs. Un usage solo n’a pas les mêmes besoins qu’un petit serveur d’équipe avec vLLM.
En collecte d’informations, refusez les tableaux de « Go exacts » non sourcés. Préférez : essai, observation de la mémoire occupée dans l’outil, ajustement. Croisez quantification, paramètres et tokens par seconde. Pour un parcours concret, installer Ollama et LM Studio montrent comment charger sans jargon inutile. Et gardez la tête froide : plus de VRAM n’excuse pas de coller des données personnelles sans cadre.
Termes voisins
| Terme | Rôle utile |
|---|---|
| RAM système | Mémoire générale du PC ; peut dépanner, souvent plus lente pour l’inférence GPU. |
| Quantification | Réduit la place des poids ; aide à tenir dans la VRAM. Voir quantification. |
| Paramètres (7B, 27B) | Taille du modèle ; plus c’est grand, plus la mémoire demande. Voir paramètres. |
| Tokens/s | Vitesse perçue ; chute souvent quand la mémoire est saturée. Voir tokens par seconde. |
Pour aller plus loin
Pour dimensionner une machine, lisez le matériel et l’inférence locale. Les ateliers IAHDF : agenda. Pour rejoindre la communauté : inscription.
Questions fréquentes
Combien de VRAM pour une IA locale ?
Il n’existe pas de chiffre unique fiable hors contexte. Cela dépend du modèle, de la quantification, de la longueur de contexte et du moteur. Beaucoup d’usages grand public démarrent avec des configurations de plusieurs gigaoctets de mémoire GPU ou unifiée, mais la seule méthode honnête est de lire la fiche du modèle et de tester. Méfiez-vous des tableaux internet qui promettent « exactement X Go pour tel modèle » sans préciser version, quantification ni offload.
Puis-je faire de l’IA locale sans carte graphique dédiée ?
Oui, souvent, surtout avec de petits modèles et des moteurs qui tournent sur CPU ou sur mémoire unifiée. Ce sera en général plus lent. Pour du confort conversationnel, une accélération GPU aide. Pour découvrir, un petit modèle suffit. Pour une équipe ou des documents lourds, évaluez le matériel après avoir clarifié l’usage, pas avant. Notez le choix, testez sur vos textes, et faites relire un humain avant tout envoi engageant.
VRAM pleine : que faire en premier ?
Réduire le contexte, choisir une quantification plus légère, prendre un modèle plus petit en paramètres, ou activer un offload partiel si l’outil le propose. Fermez aussi les autres applications gourmandes en GPU. Acheter une carte n’est utile qu’après ces gestes, sauf si votre usage est déjà clairement au-dessus des capacités actuelles. Notez le choix, testez sur vos textes, et faites relire un humain avant tout envoi engageant. Conservez la version d’outil et du modèle pour pouvoir expliquer la décision à un collègue.
La VRAM sert-elle aussi au RAG ?
Le RAG ajoute surtout des passages récupérés au contexte du modèle. Plus vous injectez de texte, plus la mémoire de travail (souvent liée au GPU) est sollicitée. Un bon chunking et un reranker qui garde peu de passages pertinents aident autant que « plus de VRAM ». Dimensionnez la récupération avant de surdimensionner la carte. Notez le choix, testez sur vos textes, et faites relire un humain avant tout envoi engageant.
Comment lire la VRAM sur ma machine Windows ?
Dans les informations système ou l’outil du fabricant de la carte, cherchez la mémoire dédiée du GPU. Les chiffres affichés varient selon les outils ; prenez-les comme ordre de grandeur et confirmez en chargeant un modèle tout en observant l’occupation mémoire dans le logiciel d’IA. Sur certains portables, une partie de la mémoire est partagée : lisez la doc constructeur plutôt qu’un chiffre de forum. Notez le choix, testez sur vos textes, et faites relire un humain avant tout envoi engageant.
