La question revient dans chaque atelier IAHDF : mon PC peut-il faire tourner une IA locale, et laquelle ? Ce guide vous apprend à lire votre mémoire (VRAM ou unifiée), à relier ordres de grandeur et familles de modèles (Gemma 4, Qwen3, Qwen 3.8 27B, Ministral 3, Mistral Small 4, gpt-oss…), et à choisir une quantification sans croire aux captures marketing. Pas de classement chiffré inventé : une méthode pour mesurer chez vous, à Lille comme à Beauvais.
Calculer le budget mémoire utile
Sous Windows, l’onglet Performance du Gestionnaire des tâches indique la mémoire GPU dédiée. Sous Linux, `nvidia-smi` ou les outils AMD équivalents. Sur Mac Apple Silicon, Activity Monitor montre la mémoire unifiée : CPU et GPU puisent dans le même pool. Retenez le chiffre « vraiment libre » : un navigateur avec quarante onglets, Docker et un IDE mangent une part non négligeable sur un portable de consultant à Roubaix.
Formule mentale prudente : la place prise croît avec le nombre de paramètres et le nombre de bits par poids, plus une marge pour le contexte (historique + documents). En ordre de grandeur, passer d’une quantification moyenne à une plus agressive réduit la mémoire au prix de la qualité. N’utilisez pas une formule comme une mesure de laboratoire IAHDF : elle sert à éviter de télécharger un monstre impossible, pas à prédire le token par seconde.
Profils types : 8, 16, 24 Go et Mac
Ces profils sont des boussoles, pas des garanties. Un GPU annoncé à 8 Go convient surtout aux petits modèles et quantifications légères, idéaux pour découvrir Ollama ou préparer un atelier. À 16 Go, vous ouvrez des modèles moyens et, parfois, des denser plus gros très quantifiés — avec latence et qualité à valider. À 24 Go, un 27B en quantification moyenne devient un objectif réaliste pour beaucoup de postes de bureau, sous réserve du reste de la machine.
Sur Mac, 16 Go unifiés demandent de la discipline (petit modèle, contexte modéré). 32 Go et plus changent l’expérience pour des modèles plus ambitieux. Un Mac Mini dans une association de Compiègne et un PC Windows d’occasion à Lens avec la même « étiquette 16 Go » ne se comportent pas pareil : architecture, bande passante mémoire et chaleur diffèrent. D’où l’obligation de chronométrer chez vous.
| Budget mémoire | Orientation prudente | Piège fréquent |
|---|---|---|
| ~8 Go VRAM | Petits LLM, quantification légère, contexte court | Vouloir un 27B « parce que la fiche le montre » |
| ~16 Go VRAM | Modèles moyens ; gros modèles très quantifiés | Oublier embedding + Docker + navigateur |
| ~24 Go VRAM | 27B dense en quantification moyenne souvent jouable | Contexte énorme + RAG lourd en même temps |
| Mac 16 Go unifiés | Petits / moyens, MLX ou Ollama sobres | Comparer à une RTX sans mesurer |
| Mac 32 Go+ unifiés | Plus de marge pour modèles ambitieux | Laisser trop d’apps ouvertes |
Lire les familles de modèles sans se noyer
Les noms du moment — Gemma 4, Qwen3, Qwen 3.8 27B, Ministral 3, Mistral Small 4, gpt-oss et d’autres — évoluent vite. Ce qui compte pour votre choix : taille indicative, licence, langue (français), outillage (outils / JSON), et disponibilité d’un tag Ollama ou d’un poids GGUF/MLX. Ne mémorisez pas un classement : mémorisez une méthode de shortlist.
Pour un usage rédactionnel en français dans une collectivité d’Amiens, testez deux candidats de taille compatible avec votre mémoire sur le même jeu de prompts. Pour du code, ajoutez des prompts de correction. Pour du RAG, jugez surtout la capacité à suivre les extraits fournis (voir RAG local et embeddings). Un modèle « plus grand » qui ignore les sources perd face à un plus petit discipliné.
Petit modèle fluide
Idéal pour ateliers, démonstrations, brouillons rapides.
- Faible latence perçue
- Moins de VRAM
- Raisonnement long plus fragile
Modèle moyen
Bon compromis bureau / association si la machine suit.
- Meilleure tenue des consignes
- Encore raisonnable en quantification moyenne
- Demande un vrai essai chronométré
Gros dense (ex. 27B)
Quand la mémoire et le silence ventilateur le permettent.
- Meilleure marge sur tâches complexes
- Coût mémoire et chaleur
- Inutile si le RAG ou le prompt sont pauvres
Choisir la quantification
La quantification réduit la précision des poids pour tenir en mémoire. Les libellés du type Q8, Q5, Q4, Q3 (et variantes) désignent des familles de compromis. En pratique : plus le chiffre de bits est bas, plus c’est léger et plus le risque de dégradation augmente. Commencez par la quantification recommandée sur la fiche du tag, puis descendez seulement si le modèle ne charge pas ou échange massivement avec le disque.
Signes que vous êtes allés trop bas : Français cassé, consignes oubliées, hallucinations plus fréquentes, JSON invalide. Signes que vous pouvez remonter : VRAM encore large, réponses trop « plates » sur vos cas. Gardez deux tags (qualité vs vitesse) sur une machine de médiation à Arras pour basculer selon l’atelier.
Pas à pas : choisir et valider un modèle
Noter la mémoire réellement disponible
Fermez les applications inutiles, mesurez VRAM ou mémoire unifiée libre, notez aussi l’espace disque. Sur un PC de collectivité verrouillé à Cambrai, vérifiez que vous avez le droit d’installer Ollama ou LM Studio. Sans droit d’install, le plus beau tableau de modèles ne servira à rien : parlez à la DSI avec un besoin clair (local, pas de cloud). Si quelque chose échoue, arrêtez-vous et notez le message exact avant de retenter. Une capture d’écran des logs vaut mieux qu’une reformulation de mémoire, surtout quand un collègue de Douai ou Arras reprendra le dossier le lendemain.
Shortlister deux ou trois tags compatibles
Sur ollama.com/library ou Hugging Face, filtrez par taille indicative et licence acceptable pour votre structure. Copiez les tags exacts. Évitez d’empiler dix téléchargements « au cas où » : un pull massif remplit le disque d’un portable de terrain à Abbeville en une après-midi. Gardez un bloc-notes ouvert : commande tapée, résultat attendu, résultat obtenu. Cette trace courte accélère le dépannage et évite de croire qu’« on a déjà essayé » sans preuve. Complétez par un test de non-régression : refaites le même geste après avoir fermé puis rouvert l’outil, afin de confirmer que la configuration survit au redémarrage et reste compréhensible pour un collègue qui n’a pas suivi toute la session.
Préparer une batterie de prompts fixes
Trois prompts minimum : résumé d’un paragraphe local, rédaction d’un mail formel, question piège (demander une date absente du texte). Ajoutez un prompt code si besoin. Gardez les mêmes textes pour comparer les modèles : sinon vous comparez vos reformulations, pas les modèles. Vérifiez aussi l’environnement : VPN, proxy, antivirus, espace disque. Beaucoup d’échecs attribués au modèle viennent d’un réseau d’entreprise à Lille ou d’un disque plein après plusieurs pulls. Ajoutez une vérification métier : demandez à une personne du terrain de reformuler le besoin en une phrase, puis vérifiez que votre réglage répond vraiment à cette phrase, pas seulement au scénario technique imaginé au départ.
Chronométrer charge et première réponse
Mesurez le temps jusqu’au premier token et le confort subjectif (bruit, chaleur, fluidité). Notez si le système swap (disque qui s’affole). Un modèle « intelligent » mais inutilisable en réunion n’est pas le bon choix pour un espace Proch’IA. L’objectif est un outil adopté, pas un record théorique. Quand l’étape réussit, marquez-la explicitement dans votre checklist. Les bascules trop rapides vers l’étape suivante masquent des configs demi-installées qui cassent plus tard en démo publique.
Juger la qualité sur vos critères
Cocher : français correct, consignes respectées, refus de inventer la date absente, format demandé tenu. Si vous faites du RAG, jugez avec extraits fournis. Ne recopiez pas de scores de leaderboard trouvés sur le web comme s’ils étaient vos mesures : ils ne disent rien de votre GPU d’occasion à Valenciennes. Si vous travaillez à deux, faites reformuler le geste par la personne la moins technique. Ce qui n’est pas dit clairement maintenant reviendra en ticket flou après l’atelier.
Documenter le choix et la date
Écrivez tag, quantification, mémoire libre observée, date (septembre 2026 ou autre), et verdict. Dans six mois, les noms auront bougé ; votre méthode restera. Partagez cette fiche dans l’équipe pour éviter que chacun re-télécharge le même monstre. Testez une fois « à froid » après redémarrage de la machine. Un service qui ne survit pas au reboot n’est pas prêt pour une permanence à Valenciennes ou Amiens. Documentez le contournement éventuel (petit modèle, localhost, hors VPN) pour ne pas rester bloqué en démonstration publique : un plan B écrit vaut mieux qu’une improvisation sous le regard d’un public à Lille ou Amiens.
Contexte, offload et astuces de survie
Allonger le contexte (historique long, gros PDF collé) augmente la mémoire utilisée. Si vous approchez de la limite, réduisez l’historique, résumez, ou passez par un RAG qui n’envoie que des extraits (réglages RAG). L’offload partiel vers le CPU (selon runtime) peut faire « rentrer » un modèle : souvent au prix d’une lenteur marquée. Utile pour un essai ponctuel, pénible au quotidien.
Fermez les autres chargeurs de modèles : LM Studio + Ollama + un second serveur qui gardent chacun un poids en VRAM, c’est la surprise classique du « ça marchait hier ». Sur Mac, voyez MLX et Ollama ; sur AMD, ROCm ou Vulkan.
Mac vs PC : ne pas comparer les autocollants
Un Mac M-series avec 32 Go unifiés peut offrir une expérience fluide sur des modèles qui feront souffrir un PC avec 8 Go de VRAM dédiée. Inversement, un PC avec 24 Go de VRAM dédiée bien refroidi reste une référence confortable pour beaucoup de denser. Le critère n’est pas la marque : c’est votre mesure locale + votre usage (chat, code, RAG, atelier public).
Pour une flotte hétérogène (Maison de l’IA, lycée, association), standardisez plutôt la méthode de choix et un modèle « plancher » commun, puis autorisez un modèle plus gros sur les postes qui le tiennent. Évitez d’imposer un unique 27B à toute la flotte.
Protocole d’essai reproductible
Sans chiffre de labo à recopier, vous pouvez quand même être rigoureux. Même machine, mêmes apps ouvertes, même prompt, deux tags, grille OK/KO. Ajoutez une colonne « serait-je à l’aise de montrer ça en public à Douai ? ». Cette colonne élimine les configurations justes mais stressantes.
- Mémoire libre avant test
- Tag exact et date de pull
- Temps perçu jusqu’à première réponse
- Qualité sur 3–5 prompts fixes
- Bruit / chaleur / stabilité 15 minutes
- Décision : garder / rejeter / retester en Q inférieur
Quand ça ne rentre pas
Le pull réussit mais le run échoue : manque mémoire au chargement, ou backend GPU mal détecté. Le run démarre puis gèle : contexte trop large ou thermal throttle. Windows qui « ram » tout le système : swap disque — descends quantification ou taille. Message CUDA/ROCm : pilote ou runtime, pas le choix du nom commercial du modèle. Dans le doute, validez d’abord un tout petit tag connu pour prouver que la pile marche.
Autre cas fréquent en entreprise à Lille : l’antivirus verrouille le dossier des modèles pendant le pull. Ajoutez une exception raisonnée avec la DSI, ou tirez les modèles sur un créneau hors scan intensif. Sur un PC portable en atelier à Lens, la mise en veille coupe parfois le service Ollama : désactivez la veille pendant les démos, sinon le public croira que « l’IA locale ne marche pas ».
Scénarios concrets Hauts-de-France
Association culturelle à Amiens, Mac Mini 16 Go : shortlist de petits et moyens modèles, un tag « atelier » fluide, interdiction de pull libre pour les bénévoles. Collectivité à Arras, tour Windows 24 Go VRAM : un dense type 27B en quantification moyenne pour le secrétariat de direction, plus un modèle léger pour l’accueil public. Freelance à Roubaix, PC 8 Go VRAM : pas de 27B ; focus rédaction et résumé avec un petit modèle, et cloud uniquement pour ce qui est déjà non sensible.
Lycée ou club info à Valenciennes, parc hétérogène : standardisez la méthode (cette page) plutôt que le même tag partout. Documentez trois profils machine sur une feuille affichée près des postes. Les élèves apprennent ainsi à choisir, pas à subir un unique monstre lent. Pour un espace Proch’IA, gardez toujours un modèle de secours déjà tiré : le Wi-Fi public rate les gros téléchargements aux heures de pointe.
Animer un choix de modèle en atelier
En présentiel, projetez la grille OK/KO plutôt qu’un slide de classements. Faites tirer deux tags devant le public, posez le même prompt local (annonce d’événement à Boulogne, mail à un usager de Dunkerque). Demandez un vote à main levée sur la fluidité, puis discutez la qualité. Cette séquence de vingt minutes ancre mieux le propos que n’importe quelle courbe marketing.
Prévoyez le plan B : si le gros modèle ne charge pas, basculez sans panique vers le petit tag. Expliquez que c’est exactement le geste professionnel. Les participants repartent avec une compétence portable, utile dès le lendemain sur leur machine personnelle à Beauvais ou Compiègne.
Questions fréquentes
Puis-je me fier au nombre de paramètres seul ?
Non. L’architecture, la quantification, le contexte et la qualité d’entraînement comptent. Un modèle plus petit spécialisé peut battre un plus grand mal quantifié sur votre tâche. Utilisez la taille comme filtre de mémoire, puis jugez sur vos prompts. Les classements publics ne remplacent pas un essai sur le PC qui servira vraiment. Pour trancher chez vous, reproduisez le scénario sur la machine réelle avec un protocole court écrit à l’avance. Une conclusion d’atelier à Roubaix ne se transfère pas telle quelle sur un portable différent.
16 Go suffisent-ils pour Qwen 3.8 27B ?
Parfois, avec une quantification plus agressive et un contexte contenu — ce n’est pas une promesse. Sur certaines machines, ce sera lent ou instable ; sur d’autres, acceptable. Traitez 24 Go comme un ordre de grandeur plus confortable pour un 27B en quantification moyenne, et mesurez. Si le résultat est limite, un modèle moyen mieux installé rendra plus service au quotidien. Gardez une fiche datée : question, hypothèse, test, résultat. Cette hygiène évite les débats sans fin et construit une mémoire utile pour la prochaine personne référente.
CPU seulement : utile ou illusoire ?
Utile pour apprendre, pour de tout petits modèles, ou pour des traitements asynchrones. Illusoire si vous attendez une conversation fluide façon cloud sur un gros dense. Pour un premier contact à Laon sur un vieux PC de bureau, visez petit et honnête plutôt que décevoir l’équipe. Si deux camps s’opposent dans l’équipe, imposez un A/B sur la même batterie de prompts plutôt qu’un vote d’opinion. Le terrain tranche plus vite que les digressions de salon.
Comment gérer plusieurs personnes et une seule machine ?
Un seul gros modèle chargé, file d’attente humaine, ou API locale avec discipline. Évitez que chacun lance son runtime. Open WebUI (install Docker) aide à partager une interface. Surveillez qui allonge le contexte : un utilisateur peut rendre l’instance inutilisable pour les autres. Méfiez-vous des captures hors contexte trouvées en ligne. Sans connaître quantification, contexte et charge machine, un chiffre spectaculaire ne dit rien de votre poste à Beauvais. Mesurez aussi le confort subjectif (bruit, chaleur, temps d’attente ressenti) : un réglage « correct » sur le papier mais pénible au quotidien ne sera pas adopté par une équipe de collectivité ou d’association.
Les noms changent tout le temps : que conserver ?
Votre grille d’évaluation, vos prompts fixes, et la fiche « tag + date + verdict ». Les familles iront et viendront. La compétence durable, en Hauts-de-France comme ailleurs, est de savoir choisir et retirer un modèle, pas de réciter un catalogue. Quand le problème semble intermittent, journalisez l’heure, la température perçue et les autres apps ouvertes. Les coïncidences thermiques et mémoire sont fréquentes sur machines partagées. Si le résultat est ambigu, changez une seule variable et rejouez immédiatement le même protocole : c’est la seule façon d’apprendre quelque chose d’exploitable plutôt que d’empiler des impressions contradictoires.
