Quels modèles open source installer chez soi en 2026 ? Ce comparatif refuse les benchmarks inventés et les podiums chiffrés magiques. Il ordonne des critères utiles : installabilité, licence, français, matériel en ordre de grandeur, usages RAG. Protocole machines A/B/C, tableau qualitatif, scènes HdF, opérations, limites, mode pour refaire. IAHDF n’est rémunéré par aucun éditeur de modèles ni revendeur de matériel. Lecture critique, vouvoiement, honnêteté totale.
Open source, open weight : clarifier
On parle souvent d’« open source » pour des poids téléchargeables (open weight) dont la licence peut restreindre l’usage commercial. Avant d’installer, lisez la licence du modèle et celle des outils (Ollama, LM Studio, llama.cpp, Open WebUI). Ce papier cite des familles courantes en 2026 — Qwen, Gemma, Mistral, DeepSeek, GLM, gpt-oss et proches — comme exemples, pas comme liste d’or figée.
Reliez à installer Ollama, LM Studio, Qwen + Open WebUI + RAG, quel modèle selon machine, écart vs propriétaires.
Protocole local (sans benchmark inventé)
Machines de référence conceptuelles : A) PC environ 16 Go VRAM, B) PC environ 24 Go VRAM, C) Mac Apple Silicon mémoire unifiée 32–64 Go. On observe : est-ce chargeable ? latence ressentie au premier token ; fluidité en conversation ; contexte utilisable sans swap douloureux ; qualité sur la batterie de 12 épreuves (mêmes prompts que le grand test) ; option RAG français sur corpus public régional (voir embeddings / réglages RAG).
Quantifications : on parle en ordres de grandeur (Q4 / Q5 / Q8) — plus compressé = souvent plus léger et parfois moins fin — sans publier ici un tableau de tokens/s inventé. Mesurez chez vous si besoin ; ne croyez pas un screenshot anonyme.
Ce qu’on ne peut pas conclure : qu’un modèle « bat GPT » en général, qu’un score Hugging Face décide pour votre mairie, qu’une licence permissive excuse une mauvaise hygiène données. On peut conclure : sur telle machine, telle famille s’installe et reste utilisable pour tel geste.
(Identique à l’épreuve 1 du grand test.) Je suis [rôle] dans [structure] à [ville des Hauts-de-France]. Rédige un courriel de [n] mots pour [public]. Faits autorisés uniquement : [liste]. N’invente rien. Si une info manque, pose une question.
En t’appuyant UNIQUEMENT sur les documents fournis dans la base : Réponds à : [question sur une délibération / guide d’aide public]. Cite le passage source. Si la réponse n’est pas dans les documents, dis « absent du corpus ». Interdiction d’utiliser ta mémoire hors corpus.
Pour le modèle [nom + quantification] sur machine [A/B/C] : - Téléchargement : simple / laborieux - Chargement : OK / trop juste / échec - Français courriel : utilisable / corrigible / faible - Licence relue : usage perso OK ? usage asso/TPE OK ? - Effort admin (mises à jour, UI) : faible / moyen / élevé Pas de note sur 10 : mots seulement.
Critères dans l’ordre (honnête)
1) Matériel en ordre de grandeur : un 7–9B quantifié tient souvent sur des configs modestes ; un 27B+ demande davantage de VRAM ou une mémoire unifiée généreuse ; au-delà, attendez-vous à de la lenteur ou à de l’offload. 2) Licence : lisez avant un usage pro. 3) Français : testez vos prompts, pas un bench anglais. 4) Installabilité : Ollama / LM Studio / scripts. 5) Écosystème RAG et outils. 6) Communauté et cadence de mises à jour — en dernier, pas en premier.
Tableau qualitatif par familles de modèles
| Critère | Familles type Qwen | Familles type Gemma | Familles type Mistral | Familles type DeepSeek / GLM / autres |
|---|---|---|---|---|
| Installabilité courante | Souvent bonne via hubs populaires | Bonne ; vérifier conditions Google | Bonne ; lire licences Mistral | Variable selon convertisseurs GGUF/MLX |
| Matériel (ordre de grandeur) | Du petit au 27B+ selon variante | Gammes légères à moyennes fréquentes | Petits et moyens fréquents en local | Certaines variantes raisonnement plus lourdes |
| Français utile | Souvent compétitif à tester | Correct à bon selon taille | Bon ancrage européen à vérifier | Hétérogène : testez vos textes |
| Licence / usage org | Lire la licence exacte du tag | Contraintes possibles : lire | Lire ; distinguer modèle et produit Le Chat | Très variable : lire deux fois |
| RAG FR (tendance) | Bon candidat si embedding adapté | OK avec bons réglages | OK | OK si le modèle suit les instructions de citation |
| Pour qui | Tech à l’aise, RAG docs publics | Débutants locaux motivés | Curieux FR / EU | Expérimentateurs selon hardware |
Scènes Hauts-de-France
À Lille, un FabLab a fait tourner un petit modèle pour une démo grand public : l’intérêt était la machine visible, pas la perf absolue. À Amiens, une asso a indexé des PDF d’aides publiques (pas de dossiers individuels) : le gain est la citation du corpus, pas la « magie » du poids.
À Valenciennes, un artisan avec PC 16 Go a choisi un modèle plus petit après un 27B trop lent : décision honnête. À Boulogne, un lycée technique a préféré une image Docker maîtrisée à un zoo de modèles. La pédagogie gagne quand on réduit le nombre de variables.
Licences : le critère qu’on saute trop vite
Avant un usage TPE / collectivité, lisez : droits de redistribution, usage commercial, clauses d’attribution, limites de services. Un modèle « gratuit à télécharger » n’est pas forcément libre au sens OSI. En cas de doute, demandez à quelqu’un qui lit les licences — pas au modèle lui-même.
Ce que le test ne prouve pas
Il ne prouve pas qu’un open-weight remplace tous les cloud. Il ne prouve pas la souveraineté complète (vous dépendez encore de mises à jour, de GPU, d’électricité). Il ne prouve pas qu’un RAG local est fidèle sans évaluation (évaluer un RAG). Il ne prouve aucun classement mondial.
Comment refaire le choix chez vous
Décider en une après-midi
Mesurer la machine
VRAM ou mémoire unifiée, disque libre, OS. Classe A/B/C approximative.
Deux modèles max
Un « petit confort », un « plus grand juste chargeable ». Même prompt courriel.
Lire la licence
Avant usage pro. Noter OK / doute / non.
Option RAG public
Seulement sur documents publics. Exiger « absent du corpus ».
Pour aller plus loin : l’agenda, l’inscription. Écart avec le fermé : propriétaire vs open source.
La stack compte autant que le poids
Un bon modèle dans une UI instable fatigue. Open WebUI, droits, sauvegardes (MAJ / sauvegarde), sécurisation si exposé (sécuriser) : prévoyez le temps admin. Sinon restez cloud avec charte.
Le français se teste, il ne se déduit pas
Un modèle brillant en anglais peut être moyen sur un courriel administratif français. Gardez vos briefs HdF. Le test à l’aveugle français s’applique aussi en local : anonymisez A/B.
Profiler sa machine sans se mentir
Sous Windows, identifiez la carte graphique et la VRAM disponible ; sous Linux, les mêmes infos via les outils système ; sur Mac Apple Silicon, la mémoire unifiée et les versions MLX / Ollama récentes. Notez l’espace disque : les poids pèsent lourd, et multiplier les quantifications remplit un SSD plus vite qu’on ne croit. Classez-vous A/B/C de façon approximative, sans vanity : un PC de bureau de bureau n’est pas une 24 Go magique.
La chaleur, le bruit et la consommation comptent dans un open space ou une médiathèque. Un modèle « impressionnant » qui transforme la salle en soufflerie échouera socialement. Mesurez le confort humain, pas seulement la fluidité textuelle.
Les mini-PC et Raspberry Pi relèvent d’un autre régime : petits modèles, usages démonstratifs (IA sur Pi / mini-PC). Ne promettez pas un RAG régional lourd sur une machine de kiosk sans essai.
Quantifications : en parler sans jargon inutile
Quantifier, c’est compresser les poids pour tenir en mémoire. Les libellés type Q4, Q5, Q8 désignent des familles de compression courantes dans l’écosystème GGUF. En ordre de grandeur, plus le chiffre est bas, plus c’est léger et potentiellement moins fin. Ce n’est pas une morale : c’est un compromis. Testez la même famille en deux quantifications sur votre courriel type plutôt que de croître un bench.
Sur Mac, les formats MLX peuvent différer des GGUF : suivez les tutos à jour (Mac MLX). L’important est la reproductibilité de votre choix (nom du tag, date, outil).
Évitez d’empiler quinze variantes « au cas où ». Deux suffisent pour décider. Le zoo de modèles est un anti-pattern associatif : personne ne sait plus laquelle est la bonne.
Opérations : sauvegarde, MAJ, droits
Prévoir qui met à jour Ollama / Docker / Open WebUI, où vivent les volumes, comment on restaure (sauvegarde). Sans cette phrase nommée dans une réunion, le local devient un hobby fragile. Les droits utilisateurs (Open WebUI équipe) évitent qu’un stagiaire télécharge n’importe quel poids de 40 Go.
Si vous exposez hors du poste, la sécurisation n’est pas optionnelle (HTTPS, proxy). Un modèle local ouvert sur Internet sans garde-fous est une mauvaise idée, quelle que soit la qualité du français.
Journalisez les incidents : modèle qui ne charge plus, disque plein, UI cassée après MAJ. Cette journalisation vaut tous les leaderboards.
RAG local en français : exigences minimales
Corpus public seulement pour commencer (délibérations, guides d’aides). Embedding multilingue adapté (embeddings FR). Réglages de chunks (réglages). Évaluation avec un jeu de questions (évaluer). Consigne « absent du corpus ». Sans cela, vous aurez un perroquet local aussi halluciné qu’un cloud, seulement plus lent à installer.
Les PDF scannés demandent un OCR (OCR). Beaucoup d’échecs « mon RAG est nul » sont des échecs de texte invisible. Diagnostiquez avant de changer de modèle.
Une démo régionale réussie montre une citation exacte tirée d’une page 4, pas une réponse fluide sans guillemets. Formez le public à exiger la citation.
Pièges d’achat matériel (ordres de grandeur)
Acheter une carte « pour faire de l’IA » sans mesurer l’alimentation, le boîtier, le bruit et le besoin réel est un classique. Demandez-vous d’abord quels modèles vous chargerez vraiment. Un usage courriel n’exige pas le même ordre de grandeur qu’un atelier vision concurrentiel. Louer ponctuellement un GPU en France (serveur GPU) peut valoir mieux qu’un achat sous-utilisé.
Méfiez-vous des bundles marketing qui mélangent licence logicielle propriétaire et rêve open source. Lisez chaque brique. Vérifiez la compatibilité AMD/NVIDIA/Mac avant facture (GPU AMD si concerné).
Pour une structure publique, ajoutez la commande publique, la garantie, et le support. Un bench Twitter ne remplace pas un bon de commande clair. IAHDF ne vend pas de matériel et n’est pas commissionné.
Enfin, budgétez le temps humain à côté du hardware. Sans heures de maintenance, le matériel devient un presse-papier chaud. Cette phrase devrait figurer dans tout dossier de financement interne.
Scénarios de choix (récits)
Scénario 1 : indépendant avec PC 16 Go — petit ou moyen modèle via LM Studio, usage courriel et reformulation, pas de serveur. Scénario 2 : asso avec bénévole tech — Ollama + Open WebUI sur un tour, corpus d’aides publiques, pas de données adhérents. Scénario 3 : PME avec SI — décision licence + éventuellement GPU cloud français (serveur GPU France) plutôt qu’un PC sous le bureau du stagiaire.
Scénario 4 : lycée / FabLab — démo pédagogique avec petit modèle, script d’effacement des conversations, focus sur la lecture critique plutôt que sur la perf. Scénario 5 : collectivité — pas de local sauvage ; cadrage DSI ; peut-être un POC isolé. Dans tous les scénarios, la qualité textuelle se mesure avec les prompts du grand test, pas avec un tweet.
S’appuyer sur la communauté tech régionale
Les meetups, FabLabs, clubs Dev et ateliers IAHDF accélèrent le diagnostic matériel. Apportez une fiche : OS, RAM/VRAM, objectif (courriel, RAG public, démo). Repartez avec deux tags de modèles à tester, pas avec vingt. La sobriété du choix est un geste d’ingénierie.
Documentez vos succès modestes : « tel modèle Q4 sur telle machine tient le courriel ». Ces notes locales valent mieux qu’un classement mondial. Déposez-les dans votre wiki interne. Offrez-les en atelier sans données sensibles.
Si personne n’est disponible pour maintenir, choisissez explicitement le cloud cadré plutôt qu’un local fantôme. L’honnêteté ops fait partie de l’éthique IAHDF. Voir aussi l’écart ouvert / fermé et l’agenda.
Rappel final avant d’installer
Installez peu, mesurez beaucoup, lisez la licence, gardez un corpus public pour vos essais RAG, et nommez un mainteneur. Si ces quatre conditions ne sont pas réunies, reportez le local et restez sur un cloud cadré le temps d’apprendre. La maturité open-weight se voit dans la routine, pas dans le premier téléchargement spectaculaire. Poursuivez avec l’écart vs propriétaires et les rendez-vous sur l’agenda.
Questions fréquentes
Quel est le meilleur LLM open source en 2026 ?
Celui qui charge sur votre machine, respecte une licence compatible avec votre usage, et passe vos prompts français avec le moins de retouches. Nous refusons un classement chiffré unique et les benchmarks inventés. Les familles Qwen, Gemma, Mistral et d’autres sont des candidates à tester, pas des médailles éternelles. Documentez votre choix (machine, quantification, date). Pour l’écart avec le cloud, lisez propriétaire vs open source. IAHDF n’est rémunéré par aucun éditeur. Cette réponse détaillée vise à vous donner assez de contexte pour décider sans score magique, en gardant la relecture humaine, la vérification des faits et le cadre de votre structure comme priorités non négociables.
Combien de VRAM faut-il ?
Raisonnez en ordres de grandeur : petits modèles pour configs modestes ; milieux de gamme autour de seize gigaoctets de VRAM souvent plus confortables ; gros modèles vers vingt-quatre gigaoctets et plus, ou Mac à mémoire unifiée généreuse. Les chiffres exacts dépendent de la quantification et du contexte. Plutôt que de croire une règle magique, tentez un chargement réel et baissez de taille si c’est trop juste. Voir aussi quel modèle selon machine. Cette réponse détaillée vise à vous donner assez de contexte pour décider sans score magique, en gardant la relecture humaine, la vérification des faits et le cadre de votre structure comme priorités non négociables.
Open source veut-il dire libre pour mon association ?
Pas forcément. Open weight ≠ licence libre sans contrainte. Lisez le texte de licence du modèle et des outils. En cas de doute pour un usage commercial ou public, faites relire par quelqu’un de compétent. Ne demandez pas au modèle s’il a le droit d’être utilisé : ce n’est pas une source juridique. La prudence licence fait partie du professionnalisme local. Cette réponse détaillée vise à vous donner assez de contexte pour décider sans score magique, en gardant la relecture humaine, la vérification des faits et le cadre de votre structure comme priorités non négociables.
Puis-je me passer complètement du cloud ?
Pour certains gestes oui, si votre machine et votre stack suivent. Pour la recherche web fraîche, certains multimodaux lourds, ou le confort zéro admin, beaucoup gardent un hybride. L’hybride se cadre (local + API). Le local réduit l’exposition distant ; il n’abolit ni la relecture ni les risques d’erreur factuelle. Cette réponse détaillée vise à vous donner assez de contexte pour décider sans score magique, en gardant la relecture humaine, la vérification des faits et le cadre de votre structure comme priorités non négociables. En pratique, gardez une trace datée de votre test, refusez les captures hors contexte, et préférez toujours une décision d’usage écrite à une opinion de couloir influencée par un classement du mois.
Où trouver de l’aide pour installer en région ?
Documentation IAHDF (Ollama, RAG, etc.), pairs techniciens, FabLabs, ateliers listés sur l’agenda. Rejoignez la communauté via l’inscription. Apportez votre config réelle (OS, mémoire) plutôt qu’un rêve de 70B sur un PC office. L’entraide locale bat les captures de bench hors sol. Cette réponse détaillée vise à vous donner assez de contexte pour décider sans score magique, en gardant la relecture humaine, la vérification des faits et le cadre de votre structure comme priorités non négociables. En pratique, gardez une trace datée de votre test, refusez les captures hors contexte, et préférez toujours une décision d’usage écrite à une opinion de couloir influencée par un classement du mois.
