IAHDF
Découverte d’outil

Test gpt-oss : les modèles ouverts d'OpenAI en local

ÉI Équipe IAHDF 18 min de lecture Mis à jour le 27 septembre 2026 Intermédiaire à avancé

Test gpt-oss : les modèles ouverts d’OpenAI en local — regard pédagogique IAHDF, septembre 2026. Nous répondons à la question « Peut-il tourner chez moi, et vaut-il le coup ? » pour gpt-oss, sans note, sans podium et sans tag inventé. Vous trouverez une fiche d’identité sobre, un public cible, des ordres de grandeur matériel à vérifier, une méthode d’essai (Ollama / LM Studio ou runtime adapté), trois épreuves françaises ancrées en Hauts-de-France (mail, consigne métier, piège factuel), un tableau qualitatif, le renvoi vers la licence réelle du dépôt, les limites, une FAQ, puis des pistes vers l’agenda et l’inscription. Scènes de référence : TPE à Roubaix, urbanisme à Amiens, atelier à Valenciennes, association à Lens.

Fiche d’identité (sans score)

Dans une TPE de Roubaix curieuse de « modèles ouverts OpenAI » sans abandonner le local, la première information utile n’est pas un score : c’est le type de poids. gpt-oss appartient à la famille OpenAI open weights. La variante retenue ici : lignes 20B et 120B telles que publiées (vérifiez les noms exacts sur la fiche 2025–2026). La fiche du modèle indique la taille, le contexte annoncé et les formats disponibles ; lisez-la sur cartes gpt-oss sur Hugging Face et tags Ollama s’ils existent plutôt que de mémoriser un chiffre entendu dans une démo.

Open weights signifie que des poids sont téléchargeables sous conditions. Cela ne veut pas dire « libre de toute contrainte », ni « gratuit à héberger », ni « conforme automatiquement à votre charte ». Pour gpt-oss, la mention de licence que nous retenons comme point de départ est : Apache 2.0 selon les publications gpt-oss — lisez le dépôt. Toute décision pro passe par le fichier LICENSE et les conditions d’usage du jour, pas par ce résumé.

Angle pédagogique de cette fiche : même éditeur, contrat différent : local open weights ≠ abonnement ChatGPT. Nous croisons aussi quel modèle local selon la machine pour le dimensionnement, et IA locale vs cloud lorsque la question n’est plus « quel tag » mais « où tournent les données ». Les liens cadre données / RGPD rappellent le droit ; ici on reste sur le geste technique.

En septembre 2026, le marché des poids ouverts bouge vite : noms de tags, quantifications, et même le positionnement « small / large / flash » évoluent. Cette fiche sur gpt-oss est donc volontairement procédurale. Si un détail de taille ou de licence diverge demain, gardez le geste (vérifier la fiche, copier le tag, lancer les trois épreuves) et mettez à jour vos notes internes. IAHDF préfère une page un peu prudente à une page péremptoire et déjà fausse.

Pour qui, et pour qui non

Profils à l’aise avec gpt-oss : devs, power users, équipes outils (Continue, agents). Si vous animez un atelier à Valenciennes, prévoyez une machine de démonstration connue à l’avance : rien n’est plus frustrant qu’un pull de 40 Go sur le Wi-Fi public pendant la session.

Profils pour lesquels ce n’est pas le bon départ : qui confond gpt-oss et ChatGPT cloud dans la charte interne. Dans une association à Lens, un petit modèle bien choisi (voir aussi Qwen3 8B/4B ou Ministral 3) rend souvent plus service qu’un géant qui ne charge pas. Dans un service urbanisme d’Amiens, la priorité est souvent le contrôle des documents, pas la taille marketing.

Indicateur simple « c’est pour vous » : vous acceptez de passer une heure à installer, une heure à tester trois prompts français, et trente minutes à lire la licence. Si vous voulez uniquement un chat web immédiat, un assistant cloud ou LM Studio avec un tout petit modèle suffira mieux pour la première journée.

Matériel : ordres de grandeur à vérifier

Ordre de grandeur matériel pour gpt-oss (à vérifier sur la fiche et sur votre machine) : ordre de grandeur : ~16 Go pour la petite ligne, bien plus pour 120B (selon quantification). Cadre « chez soi » : 20B souvent oui sur bonne machine ; 120B plutôt serveur. Ces fourchettes dépendent de la quantification, du contexte demandé, du runtime (Ollama, LM Studio, llama.cpp, vLLM) et des autres logiciels ouverts. Elles ne sont pas des mesures de laboratoire IAHDF.

Méthode de contrôle : notez la VRAM / mémoire unifiée libre avant chargement, chargez le modèle, regardez si le système swappe de façon agressive, puis posez une question courte. Si la machine devient inutilisable, descendez de quantification ou de taille — voir le guide par machine. Sur Mac Apple Silicon, la mémoire unifiée change les calculs : un chiffre « VRAM PC » ne se copie pas tel quel.

Disque : prévoyez large (modèle + versions + exports GGUF éventuels). Réseau : un pull depuis un site associatif à Lens ou une médiathèque peut échouer ; préférez un téléchargement anticipé. Électricité et chaleur : un serveur deux GPU dans un local mal ventilé à Roubaix n’est pas un détail.

Comment l’essayer (Ollama / LM Studio)

Principe non négociable : aucun tag inventé n’est présenté ici comme certitude. Pour Ollama : cherchez gpt-oss / les suffixes 20b–120b listés ; recopiez le tag exact. Pour Hugging Face / LM Studio : vérifiez aussi les guides d’appel d’outils fournis avec le modèle. Si le nom a changé entre août et septembre 2026, la fiche gagne.

Parcours Ollama type : installer depuis le site officiel, vérifier `ollama --version`, ouvrir la bibliothèque, copier le tag, lancer `ollama pull` puis `ollama run` avec ce tag exact. Posez d’abord une question anodine en français. Ensuite seulement, montez vos épreuves. Le tutoriel installer Ollama détaille les pièges Windows / Mac / Linux.

Parcours LM Studio : recherchez le modèle dans le catalogue, filtrez le format compatible avec votre OS (GGUF souvent), lisez la carte (licence, quantification), téléchargez, chargez, discutez. Activez le serveur local seulement si vous savez quel processus y accède. LM Studio pour débuter reste le fil conducteur si le terminal vous rebute.

Si gpt-oss n’a pas d’entrée grand public Ollama, ne forcez pas un nom voisin. Documentez le runtime recommandé sur le dépôt (souvent serveur) et, le cas échéant, un hébergeur européen — voir serveur GPU en France. L’honnêteté technique vaut mieux qu’un faux `ollama pull` recopié d’un forum.

Protocole d’essai en une séance

1

Préparer la machine et l’espace disque

Fermez les applications lourdes, vérifiez l’espace libre, notez OS et mémoire. Pour gpt-oss, gardez sous les yeux la fiche officielle ouverte dans le navigateur.

2

Copier le tag ou l’identifiant exact

cherchez gpt-oss / les suffixes 20b–120b listés ; recopiez le tag exact Si vous êtes sur LM Studio, vérifiez aussi les guides d’appel d’outils fournis avec le modèle

3

Charger et poser une question neutre

Une phrase de test en français suffit pour confirmer que l’inférence démarre. Ne jugez pas encore la qualité métier.

4

Lancer les trois épreuves HdF

Mail, consigne métier, piège factuel — textes identiques d’une session à l’autre. Remplissez le tableau qualitatif.

5

Archiver licence et notes

Enregistrez LICENSE, URL, date, tag, et vos verdicts. C’est votre preuve de diligence pour gpt-oss.

Trois épreuves en français (Hauts-de-France)

Épreuve 1 — mail professionnel. Scénario : mail de relance facture (données fictives). Demandez un courriel court, vouvoiement, faits fournis uniquement, interdiction d’inventer un montant ou une date. Critères qualitatifs : ton adapté, structure claire, absence d’ajouts fantaisistes, français naturel. Pas de note sur 10 : une colonne « acceptable / à reprendre / hors sujet » suffit.

Épreuve 2 — consigne métier. Scénario : consigne : proposer un mini plan de tests pour un script métier. Fournissez le texte source dans le prompt. Exigez une sortie structurée (liste numérotée) et la mention « information absente » lorsque le document ne dit rien. Un service urbanisme d’Amiens gagne plus à un refus honnête qu’à une pièce inventée.

Épreuve 3 — piège factuel Hauts-de-France. Scénario : une appellation d’origine ou un label régional inventé. Sans moteur web et sans document, beaucoup de modèles affirment juste. Observez s’ils inventent avec assurance. Demandez ensuite la même chose avec un extrait de page officielle collé : la réponse doit s’ancrer dans l’extrait. C’est le même réflexe que pour un RAG — voir aussi Qwen + Open WebUI + RAG.

Bonus utile en atelier : faites relire la réponse par une personne du métier (secrétaire d’asso à Lens, instructeur à Amiens, commerçant à Roubaix). Le critère « je peux envoyer tel quel » bat n’importe quel classement public.

Dans la TPE de Roubaix, le critère de succès ressemble à ceci : un mail correct en cinq minutes, sans fuite du fichier clients. Dans le service urbanisme d’Amiens, c’est une checklist fidèle au texte fourni. Dans l’atelier de Valenciennes, c’est un groupe qui comprend pourquoi le modèle a inventé une date. Dans l’asso de Lens, c’est un compte rendu relu par la secrétaire. Ces quatre scènes valent tous les classements anonymes.

Côté méthode, chronométrez si vous voulez, mais ne publiez pas une vitesse comme vérité absolue : la même machine change selon le contexte, la quantification et la charge. Nous n’affichons donc ni tokens/s ni podium. Si vous tenez un journal de bord, notez plutôt : date, tag exact, quantification, longueur du prompt, verdict qualitatif des trois épreuves, et lien vers la licence archivée.

Prompt d’épreuve mail (à adapter)
Tu rédiges un courriel professionnel en français pour mail de relance facture (données fictives).
Vouvoiement, ton simple, 8 à 12 lignes maximum.
Utilise uniquement les faits suivants :
- [fait 1]
- [fait 2]
- [fait 3]
N’invente aucun montant, date, nom d’organisme ou engagement.
Si une information manque, pose une question au lieu d’écrire.

Observations qualitatives (tableau)

Le tableau ci-dessous est qualitatif. Aucun score, aucun tokens/s, aucun podium. Il sert à organiser vos observations sur gpt-oss pendant une session de test datée.

Grille qualitative — gpt-oss
CritèreCe que vous regardezVotre observation
Prise en mainClarté de l’install gpt-oss via Ollama/LM Studio ou runtime serveurNote libre : fluide / laborieux / bloqué
Français utilitaireMail + consigne métier (épreuves 1 et 2)Acceptable / à reprendre / hors sujet
Prudence factuelle HdFPiège local sans document puis avec extraitInventé / prudent / ancré dans l’extrait
Matériel ressentiConfort sur votre machine réelleOK / limite / inadapté — sans tok/s
Licence compriseLICENSE lu et archivéOui / partiel / non lu

Complétez la grille à la main pendant le test. Deux testeurs valent mieux qu’un : l’un joue le métier (Roubaix / Amiens / Lens), l’autre guette les inventions. Pour un protocole encore plus large, les 20 prompts complètent ces trois épreuves.

Licence : lire le dépôt, ne pas inventer

Pour gpt-oss, renvoyez-vous systématiquement vers la licence réelle du dépôt (Apache 2.0 selon les publications gpt-oss — lisez le dépôt). N’inventez pas de clauses (« usage commercial illimité », « interdit aux collectivités », etc.) si elles n’y figurent pas. Si la licence est « Gemma », « qwen-community » ou autre texte dédié, lisez-le en entier : les conditions d’usage acceptable et de redistribution ne se résument pas en une phrase marketing.

Côté organisation : archivez l’URL, la date, le hash ou la révision des poids, et le fichier LICENSE dans le dossier projet. Un audit interne six mois plus tard vous remerciera. La licence du modèle ne remplace pas non plus le contrat de votre hébergeur ni votre analyse RGPD.

Limites à garder en tête

Limites transverses des LLM locaux : hallucinations, faiblesse sur l’actualité locale fine, dérive de ton, sensibilité à la quantification, contexte fini. gpt-oss n’y échappe pas. Un modèle « open » peut aussi être médiocre sur votre jargon métier : seul votre protocole le montre.

Limites spécifiques à garder en tête pour cette fiche : même éditeur, contrat différent : local open weights ≠ abonnement ChatGPT. Matériel sous-estimé, tag obsolète, licence non lue, et confusion entre démo publique et usage interne sont les quatre échecs les plus fréquents en Hauts-de-France d’après les retours d’ateliers.

Ce n’est pas une source officielle. Ne citez jamais une réponse de gpt-oss comme preuve auprès d’un usager, d’un élu ou d’un client. Gardez vos documents d’origine. Pour le cadre données, quelles données confier et le glossaire / guide associé restent le binôme de prudence.

Lorsque vous comparez gpt-oss à d’autres candidats open weights, imposez la même grille et les mêmes textes sources. Sinon vous mesurez surtout la variance de vos prompts. Le tuto banc de test 20 prompts aide à figer un jeu. Les pages GLM-5, Qwen 27B, assistant code local prolongent la comparaison sans départager un vainqueur officiel.

Enfin, rappelez-vous qu’un modèle local peut quand même exfiltrer des données si vous le branchez maladroitement à un outil cloud, si vous exposez le port sur Internet, ou si vous indexez un dossier RH sur un PC partagé. « Open source / open weights » décrit surtout la disponibilité des poids et la licence, pas la maturité de votre gouvernance. Relisez le guide des données avant le premier corpus réel.

Pistes, agenda et inscription

Pour continuer : GLM-5, Qwen 27B, assistant code local. Pour calibrer la machine : quel modèle local. Pour un banc de prompts maison : 20 prompts pour tester. Aucune de ces pages ne désigne un gagnant universel : elles éclairent un choix situé.

Envie de croiser des retours en présentiel ? Consultez l’agenda IAHDF (ateliers, permanences, sessions locales) et l’inscription pour rejoindre la communauté. Apportez votre grille d’épreuves plutôt qu’une capture de classement : on avance plus vite.

Questions fréquentes

gpt-oss tourne-t-il sur mon PC portable ?

Cela dépend de la variante et de la quantification. Ordre de grandeur indiqué dans cette fiche : ordre de grandeur : ~16 Go pour la petite ligne, bien plus pour 120B (selon quantification). Vérifiez la fiche du modèle, puis testez. Si c’est hors de portée, regardez les petits Qwen3 ou Ministral 3, ou un hébergement GPU en France.

Quel tag Ollama dois-je copier ?

Celui affiché le jour J sur la bibliothèque officielle ou sur la carte Hugging Face reliée. cherchez gpt-oss / les suffixes 20b–120b listés ; recopiez le tag exact Ne faites pas confiance à un tag recopié dans un vieux tutoriel sans date.

Puis-je l’utiliser pour un usage professionnel ?

Seulement après lecture de la licence réelle du dépôt (Apache 2.0 selon les publications gpt-oss — lisez le dépôt) et de votre cadre interne. Cette page ne constitue pas un avis juridique. Pour les données : guide prudence et repères RGPD.

Faut-il un RAG pour les documents de ma structure ?

Dès que vos textes dépassent ce que vous voulez coller dans le prompt, un RAG local devient pertinent. Le tutoriel Open WebUI + RAG montre la chaîne ; le choix de modèle évite de surdimensionner.

Quel est le meilleur modèle open source en 2026 ?

Il n’y a pas de gagnant IAHDF. Le « meilleur » est celui qui passe vos épreuves françaises sur votre machine, sous une licence que votre organisation accepte. Comparez gpt-oss à GLM-5, Qwen 27B, assistant code local avec la même grille, pas avec un podium de réseau social.

Quatre scènes pour ancrer le test

Scène Roubaix — TPE. Vous préparez un mail client avec gpt-oss. Le fichier Excel des contacts reste fermé. Vous dictez trois faits, vous relisez, vous envoyez depuis votre messagerie habituelle. Si le modèle ajoute une remise « classique du secteur », vous rayez : ce n’était pas dans vos faits.

Scène Amiens — urbanisme. Vous collez un extrait de notice (déjà public) et demandez une liste de pièces. Toute pièce absente du texte doit être signalée comme absente. Le modèle n’est pas l’instructeur ; il aide à structurer.

Scène Valenciennes — atelier. Chaque participant note le tag exact utilisé pour gpt-oss. Vous comparez les réponses au même piège HdF. L’objectif pédagogique : voir l’hallucination collective, pas élire un champion de salon.

Scène Lens — association. Le compte rendu d’AG est relu par quelqu’un présent à la réunion. Le modèle propose une structure ; la secrétaire corrige les noms et les votes. Sans cette relecture, le local n’apporte aucune magie.

Ces scènes servent aussi de script d’atelier : une heure suffit si le pull est déjà fait. Gardez une machine « témoin » avec le tag documenté. Et rappelez en introduction que gpt-oss n’est qu’un candidat parmi d’autres open weights — voir GLM-5, Qwen 27B, assistant code local pour élargir sans couronner.

Tenir un carnet de test utile

Un carnet d’une page suffit. En-tête : date, gpt-oss, tag/révision, runtime, machine. Puis trois blocs pour les épreuves, une ligne licence (oui/non lu), une ligne « on garde / on pause / on écarte ». Ajoutez une capture uniquement si elle illustre un défaut pédagogique (invention factuelle), pas pour orner.

Partagez le carnet en interne ou en atelier IAHDF. La communauté avance plus vite avec des grilles comparables qu’avec des avis « c’est fort » sans protocole. L’agenda signale les sessions ; l’inscription permet de suivre les mises à jour éditoriales.

Si votre test de gpt-oss révèle un excellent français mais un matériel hors budget, documentez-le clairement : c’est une information d’achat, pas un échec personnel. Inversement, un petit modèle qui passe vos mails peut clôturer le sujet pendant six mois — et c’est une réussite.

Cette ressource vous a-t-elle aidé ?

Pour aller plus loin

Découverte d’outil Test Gemma 4 : les modèles ouverts de Google (E4B, 12B, 31B) 18 min · Équipe IAHDF Découverte d’outil Test Qwen3 8B et 4B : les petits Qwen sur un PC ordinaire 18 min · Équipe IAHDF Tutoriel Assistant de code local dans VS Code (Continue + modèle open source) 20 min · Équipe IAHDF