IAHDF
Découverte d’outil

Meilleurs modèles open source 2026 : lesquels installer chez soi ?

ÉI Équipe IAHDF 22 min de lecture Intermédiaire à avancé

Quels modèles open source installer chez soi en 2026 ? Ce comparatif refuse les benchmarks inventés et les podiums chiffrés magiques. Il ordonne des critères utiles : installabilité, licence, français, matériel en ordre de grandeur, usages RAG. Protocole machines A/B/C, tableau qualitatif, scènes HdF, opérations, limites, mode pour refaire. IAHDF n’est rémunéré par aucun éditeur de modèles ni revendeur de matériel. Lecture critique, vouvoiement, honnêteté totale.

Open source, open weight : clarifier

On parle souvent d’« open source » pour des poids téléchargeables (open weight) dont la licence peut restreindre l’usage commercial. Avant d’installer, lisez la licence du modèle et celle des outils (Ollama, LM Studio, llama.cpp, Open WebUI). Ce papier cite des familles courantes en 2026 — Qwen, Gemma, Mistral, DeepSeek, GLM, gpt-oss et proches — comme exemples, pas comme liste d’or figée.

Reliez à installer Ollama, LM Studio, Qwen + Open WebUI + RAG, quel modèle selon machine, écart vs propriétaires.

Protocole local (sans benchmark inventé)

Machines de référence conceptuelles : A) PC environ 16 Go VRAM, B) PC environ 24 Go VRAM, C) Mac Apple Silicon mémoire unifiée 32–64 Go. On observe : est-ce chargeable ? latence ressentie au premier token ; fluidité en conversation ; contexte utilisable sans swap douloureux ; qualité sur la batterie de 12 épreuves (mêmes prompts que le grand test) ; option RAG français sur corpus public régional (voir embeddings / réglages RAG).

Quantifications : on parle en ordres de grandeur (Q4 / Q5 / Q8) — plus compressé = souvent plus léger et parfois moins fin — sans publier ici un tableau de tokens/s inventé. Mesurez chez vous si besoin ; ne croyez pas un screenshot anonyme.

Ce qu’on ne peut pas conclure : qu’un modèle « bat GPT » en général, qu’un score Hugging Face décide pour votre mairie, qu’une licence permissive excuse une mauvaise hygiène données. On peut conclure : sur telle machine, telle famille s’installe et reste utilisable pour tel geste.

Épreuve locale — même courriel que le cloud
(Identique à l’épreuve 1 du grand test.)
Je suis [rôle] dans [structure] à [ville des Hauts-de-France].
Rédige un courriel de [n] mots pour [public].
Faits autorisés uniquement : [liste].
N’invente rien. Si une info manque, pose une question.
Épreuve locale — RAG sur PDF publics régionaux
En t’appuyant UNIQUEMENT sur les documents fournis dans la base :
Réponds à : [question sur une délibération / guide d’aide public].
Cite le passage source. Si la réponse n’est pas dans les documents, dis « absent du corpus ».
Interdiction d’utiliser ta mémoire hors corpus.
Grille d’installabilité (à remplir chez vous)
Pour le modèle [nom + quantification] sur machine [A/B/C] :
- Téléchargement : simple / laborieux
- Chargement : OK / trop juste / échec
- Français courriel : utilisable / corrigible / faible
- Licence relue : usage perso OK ? usage asso/TPE OK ?
- Effort admin (mises à jour, UI) : faible / moyen / élevé
Pas de note sur 10 : mots seulement.

Critères dans l’ordre (honnête)

1) Matériel en ordre de grandeur : un 7–9B quantifié tient souvent sur des configs modestes ; un 27B+ demande davantage de VRAM ou une mémoire unifiée généreuse ; au-delà, attendez-vous à de la lenteur ou à de l’offload. 2) Licence : lisez avant un usage pro. 3) Français : testez vos prompts, pas un bench anglais. 4) Installabilité : Ollama / LM Studio / scripts. 5) Écosystème RAG et outils. 6) Communauté et cadence de mises à jour — en dernier, pas en premier.

Tableau qualitatif par familles de modèles

Open-weight 2026 — orientation qualitative (pas un leaderboard)
CritèreFamilles type QwenFamilles type GemmaFamilles type MistralFamilles type DeepSeek / GLM / autres
Installabilité couranteSouvent bonne via hubs populairesBonne ; vérifier conditions GoogleBonne ; lire licences MistralVariable selon convertisseurs GGUF/MLX
Matériel (ordre de grandeur)Du petit au 27B+ selon varianteGammes légères à moyennes fréquentesPetits et moyens fréquents en localCertaines variantes raisonnement plus lourdes
Français utileSouvent compétitif à testerCorrect à bon selon tailleBon ancrage européen à vérifierHétérogène : testez vos textes
Licence / usage orgLire la licence exacte du tagContraintes possibles : lireLire ; distinguer modèle et produit Le ChatTrès variable : lire deux fois
RAG FR (tendance)Bon candidat si embedding adaptéOK avec bons réglagesOKOK si le modèle suit les instructions de citation
Pour quiTech à l’aise, RAG docs publicsDébutants locaux motivésCurieux FR / EUExpérimentateurs selon hardware

Scènes Hauts-de-France

À Lille, un FabLab a fait tourner un petit modèle pour une démo grand public : l’intérêt était la machine visible, pas la perf absolue. À Amiens, une asso a indexé des PDF d’aides publiques (pas de dossiers individuels) : le gain est la citation du corpus, pas la « magie » du poids.

À Valenciennes, un artisan avec PC 16 Go a choisi un modèle plus petit après un 27B trop lent : décision honnête. À Boulogne, un lycée technique a préféré une image Docker maîtrisée à un zoo de modèles. La pédagogie gagne quand on réduit le nombre de variables.

Licences : le critère qu’on saute trop vite

Avant un usage TPE / collectivité, lisez : droits de redistribution, usage commercial, clauses d’attribution, limites de services. Un modèle « gratuit à télécharger » n’est pas forcément libre au sens OSI. En cas de doute, demandez à quelqu’un qui lit les licences — pas au modèle lui-même.

Ce que le test ne prouve pas

Il ne prouve pas qu’un open-weight remplace tous les cloud. Il ne prouve pas la souveraineté complète (vous dépendez encore de mises à jour, de GPU, d’électricité). Il ne prouve pas qu’un RAG local est fidèle sans évaluation (évaluer un RAG). Il ne prouve aucun classement mondial.

Comment refaire le choix chez vous

Décider en une après-midi

1

Mesurer la machine

VRAM ou mémoire unifiée, disque libre, OS. Classe A/B/C approximative.

2

Installer une UI simple

Ollama ou LM Studio selon profil (Ollama, LM Studio).

3

Deux modèles max

Un « petit confort », un « plus grand juste chargeable ». Même prompt courriel.

4

Lire la licence

Avant usage pro. Noter OK / doute / non.

5

Option RAG public

Seulement sur documents publics. Exiger « absent du corpus ».

Pour aller plus loin : l’agenda, l’inscription. Écart avec le fermé : propriétaire vs open source.

La stack compte autant que le poids

Un bon modèle dans une UI instable fatigue. Open WebUI, droits, sauvegardes (MAJ / sauvegarde), sécurisation si exposé (sécuriser) : prévoyez le temps admin. Sinon restez cloud avec charte.

Le français se teste, il ne se déduit pas

Un modèle brillant en anglais peut être moyen sur un courriel administratif français. Gardez vos briefs HdF. Le test à l’aveugle français s’applique aussi en local : anonymisez A/B.

Profiler sa machine sans se mentir

Sous Windows, identifiez la carte graphique et la VRAM disponible ; sous Linux, les mêmes infos via les outils système ; sur Mac Apple Silicon, la mémoire unifiée et les versions MLX / Ollama récentes. Notez l’espace disque : les poids pèsent lourd, et multiplier les quantifications remplit un SSD plus vite qu’on ne croit. Classez-vous A/B/C de façon approximative, sans vanity : un PC de bureau de bureau n’est pas une 24 Go magique.

La chaleur, le bruit et la consommation comptent dans un open space ou une médiathèque. Un modèle « impressionnant » qui transforme la salle en soufflerie échouera socialement. Mesurez le confort humain, pas seulement la fluidité textuelle.

Les mini-PC et Raspberry Pi relèvent d’un autre régime : petits modèles, usages démonstratifs (IA sur Pi / mini-PC). Ne promettez pas un RAG régional lourd sur une machine de kiosk sans essai.

Quantifications : en parler sans jargon inutile

Quantifier, c’est compresser les poids pour tenir en mémoire. Les libellés type Q4, Q5, Q8 désignent des familles de compression courantes dans l’écosystème GGUF. En ordre de grandeur, plus le chiffre est bas, plus c’est léger et potentiellement moins fin. Ce n’est pas une morale : c’est un compromis. Testez la même famille en deux quantifications sur votre courriel type plutôt que de croître un bench.

Sur Mac, les formats MLX peuvent différer des GGUF : suivez les tutos à jour (Mac MLX). L’important est la reproductibilité de votre choix (nom du tag, date, outil).

Évitez d’empiler quinze variantes « au cas où ». Deux suffisent pour décider. Le zoo de modèles est un anti-pattern associatif : personne ne sait plus laquelle est la bonne.

Opérations : sauvegarde, MAJ, droits

Prévoir qui met à jour Ollama / Docker / Open WebUI, où vivent les volumes, comment on restaure (sauvegarde). Sans cette phrase nommée dans une réunion, le local devient un hobby fragile. Les droits utilisateurs (Open WebUI équipe) évitent qu’un stagiaire télécharge n’importe quel poids de 40 Go.

Si vous exposez hors du poste, la sécurisation n’est pas optionnelle (HTTPS, proxy). Un modèle local ouvert sur Internet sans garde-fous est une mauvaise idée, quelle que soit la qualité du français.

Journalisez les incidents : modèle qui ne charge plus, disque plein, UI cassée après MAJ. Cette journalisation vaut tous les leaderboards.

RAG local en français : exigences minimales

Corpus public seulement pour commencer (délibérations, guides d’aides). Embedding multilingue adapté (embeddings FR). Réglages de chunks (réglages). Évaluation avec un jeu de questions (évaluer). Consigne « absent du corpus ». Sans cela, vous aurez un perroquet local aussi halluciné qu’un cloud, seulement plus lent à installer.

Les PDF scannés demandent un OCR (OCR). Beaucoup d’échecs « mon RAG est nul » sont des échecs de texte invisible. Diagnostiquez avant de changer de modèle.

Une démo régionale réussie montre une citation exacte tirée d’une page 4, pas une réponse fluide sans guillemets. Formez le public à exiger la citation.

Pièges d’achat matériel (ordres de grandeur)

Acheter une carte « pour faire de l’IA » sans mesurer l’alimentation, le boîtier, le bruit et le besoin réel est un classique. Demandez-vous d’abord quels modèles vous chargerez vraiment. Un usage courriel n’exige pas le même ordre de grandeur qu’un atelier vision concurrentiel. Louer ponctuellement un GPU en France (serveur GPU) peut valoir mieux qu’un achat sous-utilisé.

Méfiez-vous des bundles marketing qui mélangent licence logicielle propriétaire et rêve open source. Lisez chaque brique. Vérifiez la compatibilité AMD/NVIDIA/Mac avant facture (GPU AMD si concerné).

Pour une structure publique, ajoutez la commande publique, la garantie, et le support. Un bench Twitter ne remplace pas un bon de commande clair. IAHDF ne vend pas de matériel et n’est pas commissionné.

Enfin, budgétez le temps humain à côté du hardware. Sans heures de maintenance, le matériel devient un presse-papier chaud. Cette phrase devrait figurer dans tout dossier de financement interne.

Scénarios de choix (récits)

Scénario 1 : indépendant avec PC 16 Go — petit ou moyen modèle via LM Studio, usage courriel et reformulation, pas de serveur. Scénario 2 : asso avec bénévole tech — Ollama + Open WebUI sur un tour, corpus d’aides publiques, pas de données adhérents. Scénario 3 : PME avec SI — décision licence + éventuellement GPU cloud français (serveur GPU France) plutôt qu’un PC sous le bureau du stagiaire.

Scénario 4 : lycée / FabLab — démo pédagogique avec petit modèle, script d’effacement des conversations, focus sur la lecture critique plutôt que sur la perf. Scénario 5 : collectivité — pas de local sauvage ; cadrage DSI ; peut-être un POC isolé. Dans tous les scénarios, la qualité textuelle se mesure avec les prompts du grand test, pas avec un tweet.

S’appuyer sur la communauté tech régionale

Les meetups, FabLabs, clubs Dev et ateliers IAHDF accélèrent le diagnostic matériel. Apportez une fiche : OS, RAM/VRAM, objectif (courriel, RAG public, démo). Repartez avec deux tags de modèles à tester, pas avec vingt. La sobriété du choix est un geste d’ingénierie.

Documentez vos succès modestes : « tel modèle Q4 sur telle machine tient le courriel ». Ces notes locales valent mieux qu’un classement mondial. Déposez-les dans votre wiki interne. Offrez-les en atelier sans données sensibles.

Si personne n’est disponible pour maintenir, choisissez explicitement le cloud cadré plutôt qu’un local fantôme. L’honnêteté ops fait partie de l’éthique IAHDF. Voir aussi l’écart ouvert / fermé et l’agenda.

Rappel final avant d’installer

Installez peu, mesurez beaucoup, lisez la licence, gardez un corpus public pour vos essais RAG, et nommez un mainteneur. Si ces quatre conditions ne sont pas réunies, reportez le local et restez sur un cloud cadré le temps d’apprendre. La maturité open-weight se voit dans la routine, pas dans le premier téléchargement spectaculaire. Poursuivez avec l’écart vs propriétaires et les rendez-vous sur l’agenda.

Questions fréquentes

Quel est le meilleur LLM open source en 2026 ?

Celui qui charge sur votre machine, respecte une licence compatible avec votre usage, et passe vos prompts français avec le moins de retouches. Nous refusons un classement chiffré unique et les benchmarks inventés. Les familles Qwen, Gemma, Mistral et d’autres sont des candidates à tester, pas des médailles éternelles. Documentez votre choix (machine, quantification, date). Pour l’écart avec le cloud, lisez propriétaire vs open source. IAHDF n’est rémunéré par aucun éditeur. Cette réponse détaillée vise à vous donner assez de contexte pour décider sans score magique, en gardant la relecture humaine, la vérification des faits et le cadre de votre structure comme priorités non négociables.

Combien de VRAM faut-il ?

Raisonnez en ordres de grandeur : petits modèles pour configs modestes ; milieux de gamme autour de seize gigaoctets de VRAM souvent plus confortables ; gros modèles vers vingt-quatre gigaoctets et plus, ou Mac à mémoire unifiée généreuse. Les chiffres exacts dépendent de la quantification et du contexte. Plutôt que de croire une règle magique, tentez un chargement réel et baissez de taille si c’est trop juste. Voir aussi quel modèle selon machine. Cette réponse détaillée vise à vous donner assez de contexte pour décider sans score magique, en gardant la relecture humaine, la vérification des faits et le cadre de votre structure comme priorités non négociables.

Open source veut-il dire libre pour mon association ?

Pas forcément. Open weight ≠ licence libre sans contrainte. Lisez le texte de licence du modèle et des outils. En cas de doute pour un usage commercial ou public, faites relire par quelqu’un de compétent. Ne demandez pas au modèle s’il a le droit d’être utilisé : ce n’est pas une source juridique. La prudence licence fait partie du professionnalisme local. Cette réponse détaillée vise à vous donner assez de contexte pour décider sans score magique, en gardant la relecture humaine, la vérification des faits et le cadre de votre structure comme priorités non négociables.

Puis-je me passer complètement du cloud ?

Pour certains gestes oui, si votre machine et votre stack suivent. Pour la recherche web fraîche, certains multimodaux lourds, ou le confort zéro admin, beaucoup gardent un hybride. L’hybride se cadre (local + API). Le local réduit l’exposition distant ; il n’abolit ni la relecture ni les risques d’erreur factuelle. Cette réponse détaillée vise à vous donner assez de contexte pour décider sans score magique, en gardant la relecture humaine, la vérification des faits et le cadre de votre structure comme priorités non négociables. En pratique, gardez une trace datée de votre test, refusez les captures hors contexte, et préférez toujours une décision d’usage écrite à une opinion de couloir influencée par un classement du mois.

Où trouver de l’aide pour installer en région ?

Documentation IAHDF (Ollama, RAG, etc.), pairs techniciens, FabLabs, ateliers listés sur l’agenda. Rejoignez la communauté via l’inscription. Apportez votre config réelle (OS, mémoire) plutôt qu’un rêve de 70B sur un PC office. L’entraide locale bat les captures de bench hors sol. Cette réponse détaillée vise à vous donner assez de contexte pour décider sans score magique, en gardant la relecture humaine, la vérification des faits et le cadre de votre structure comme priorités non négociables. En pratique, gardez une trace datée de votre test, refusez les captures hors contexte, et préférez toujours une décision d’usage écrite à une opinion de couloir influencée par un classement du mois.

Cette ressource vous a-t-elle aidé ?

Pour aller plus loin

Découverte d’outil IA propriétaires vs open source : l’écart de qualité en 2026 22 min · Équipe IAHDF Découverte d’outil Le grand test des IA 2026 : 12 assistants face aux mêmes 12 épreuves 22 min · Équipe IAHDF Tutoriel Installer Ollama sur Windows, Mac ou Linux et lancer son premier modèle 14 min · Équipe IAHDF