IAHDF
Tutoriel

IA sur Raspberry Pi 5 ou mini-PC : ce qui marche vraiment

ÉI Équipe IAHDF 20 min de lecture Mis à jour le 27 septembre 2026 Avancé

Une IA sur un Raspberry Pi, c’est possible — à condition d’accepter des petits modèles et des usages calmes. Ce tutoriel dit ce qui marche vraiment sur un Raspberry Pi 5 ou un mini-PC sobre : familles de modèles légers (Gemma 4 E2B, Qwen3 1.7B et équivalents du jour), installation Linux, ressenti de vitesse en ordres de grandeur qualitatifs, et limites franches. Pas de tok/s mesurés en labo IAHDF, pas de tableaux de VRAM de banc d’essai : vous apprendrez à juger sur votre machine. Angle régional : les FabLabs et ateliers numériques des Hauts-de-France qui veulent montrer une IA locale sans promettre un chat fluide digne d’un serveur GPU loué.

Pour qui : FabLabs, ateliers, pédagogie

Ce parcours s’adresse aux animateurs de FabLabs, médiateurs numériques, enseignants et bricoleurs déjà à l’aise avec Linux, qui veulent une démo tangible : « le modèle tourne ici, sans cloud ». À Lille, Roubaix, Amiens ou Valenciennes, le Pi 5 sur une table d’atelier crée souvent plus d’effet pédagogique qu’une slide sur le cloud. L’objectif n’est pas de remplacer un serveur GPU, c’est de montrer la chaîne locale et d’apprendre les limites.

Si votre besoin est un assistant fluide pour toute une équipe sur des documents longs, ce n’est pas le bon matériel. Orientez-vous vers un PC avec GPU dédié (installer Ollama, LM Studio) ou une instance louée (GPU en France). Ici, on assume le petit format.

Matériel : Raspberry Pi 5 ou mini-PC

Le Raspberry Pi 5 apporte un bond net par rapport aux générations précédentes pour l’inférence légère, surtout avec une alimentation correcte, un SSD USB ou NVMe selon votre hat, et assez de RAM (préférez les variantes les mieux pourvues si vous chargez un modèle et une interface). Refroidissement actif recommandé : un Pi qui throttle devient « trop lent pour du chat fluide » même avec un modèle minuscule.

Un mini-PC x86 récent (NUC-like, machine de bureau compacte) offre souvent plus de marge : plus de RAM, stockage interne rapide, parfois un iGPU utile selon les runtimes. Pour un atelier qui tourne toute une après-midi à Boulogne-sur-Mer, le mini-PC fatigue moins que le Pi si plusieurs participants enchaînent les prompts. Le Pi reste imbattable pour le coût d’entrée pédagogique et la clarté du geste « ordinateur monocarte ».

Prévoyez un écran ou un accès SSH/VNC, un réseau local stable, et une carte SD ou SSD de qualité : les poids de modèles et les logs usent les supports médiocres. Étiquetez la machine « labo IA — données fictives » pour éviter qu’on y colle un dossier agents par erreur.

Petits modèles : ce que viser (1–4B)

Restez dans l’ordre de grandeur 1 à 4 milliards de paramètres, en quantification adaptée à la RAM disponible. Des familles souvent citées pour le petit format incluent des variantes type Gemma 4 E2B, Qwen3 1.7B, et d’autres tags légers publiés le jour J : vérifiez toujours le nom exact sur ollama.com/library ou la fiche Hugging Face, car les suffixes changent.

Un modèle plus gros « qui finit par charger » n’est pas une victoire s’il rend l’échange pénible. Sur Pi, préférez la réactivité perçue à la taille marketing. En français, testez avec vos propres prompts d’atelier (reformuler une consigne FabLab, expliquer une étape de découpe laser, résumer un paragraphe de règlement intérieur fictif).

Usages réalistes selon le ressenti de vitesse (qualitatif)
UsageSur Pi 5 / mini-PC sobreVerdict typique
Reformuler une phrase courteRéponse en une fois, prompt brefSouvent utilisable pour du texte court
Chat multi-tours longContexte qui grossit, patience utilisateurSouvent trop lent pour du chat fluide
Résumer un long PDFBeaucoup de tokens, parfois hors RAM confortPeu réaliste : allégez ou changez de machine
Démo pédagogique « ça tourne local »Un prompt préparé, public patientExcellent angle FabLab / atelier
Assistant multi-agents simultanésCharge CPU/RAM partagéeÀ éviter sur Pi ; viser GPU ou file d’attente

Installer : Linux, runtime, interface

Partez d’une image Linux à jour (Raspberry Pi OS ou distribution du mini-PC). Installez les mises à jour, créez un utilisateur dédié, et choisissez un runtime : Ollama est souvent le plus simple pour tirer un tag et tester en CLI ; d’autres runtimes existent selon l’architecture (ARM64 vs x86_64). Vérifiez la compatibilité officielle du jour pour votre plateforme : tout ce qui « marche sur desktop NVIDIA » ne se transpose pas tel quel sur Pi.

Pour l’interface, vous pouvez rester en terminal pour la pédagogie, ou installer une UI légère (Open WebUI est possible sur machine plus à l’aise ; sur Pi, jaugez la RAM restante après le modèle). Dans un FabLab, un terminal projeté + un prompt préparé suffit parfois mieux qu’une UI lourde qui combat le modèle pour la mémoire.

Prompts de banc d’essai qualitatif (à coller tels quels)
# Banque de tests qualitatifs — ne pas transformer en « tok/s IAHDF »

1) Texte court
« Reformule en français simple, en trois phrases max :
Le FabLab ouvre samedi de 10 h à 13 h, réservation découpe laser obligatoire. »

Ressenti attendu à noter : utilisable / limite / trop lent

2) Raisonnement léger
« Donne trois précautions de sécurité pour un atelier résine, sans dramatiser. »

3) Chat fluide ?
Enchaînez cinq questions de suivi sur le même sujet.
Si l’attente entre messages devient agaçante pour un public non initié,
notez : trop lent pour du chat fluide.

4) Hors scope volontaire
Collez un long texte (> page) et demandez un résumé détaillé.
Si la machine souffre : confirmez le besoin d’une autre plateforme.

Journal : date, modèle/tag exact, machine (Pi 5 / mini-PC), ressenti — pas de débit inventé.

Mesures : ordres de grandeur qualitatifs seulement

IAHDF ne publie pas ici de tok/s issus d’un labo interne, ni de tableaux de VRAM de banc d’essai. Les chiffres circulant sur Internet dépendent du build, de la quantification, de la température, du stockage et de la version du runtime. Ce qui compte pour vous : le ressenti sur votre exemplaire, avec vos prompts, devant votre public.

Adoptez un vocabulaire honnête partagé en atelier : « utilisable pour du texte court », « acceptable en démo avec public patient », « trop lent pour du chat fluide », « inutilisable pour ce prompt ». Chronométrez au feeling ou à la montre si vous voulez, mais ne transformez pas une mesure locale en vérité universelle à publier comme « résultat IAHDF » sans protocole.

Usages qui marchent vraiment

Reformulation de consignes d’atelier, génération d’idées de projets DIY, aide à rédiger un mail de rappel de réservation, explication d’un terme technique en français simple, petit QCM pédagogique : ces tâches à prompts courts collent au Pi 5 et au mini-PC sobre. Dans un atelier à Arras ou un FabLab de la métropole lilloise, préparez trois démonstrations de deux minutes plutôt qu’une conversation libre de vingt minutes.

Vous pouvez aussi illustrer la souveraineté pédagogique : montrer que rien n’est envoyé au cloud pendant la démo (réseau coupé ou firewall démontré). Ce geste compte autant que la qualité littéraire de la réponse. Gardez des exemples fictifs : pas de données personnelles de membres du FabLab.

Limites : ce qu’il ne faut pas promettre

Ne promettez pas un remplacement de ChatGPT fluide, ni un RAG sur des centaines de PDF, ni du multi-utilisateur confortable. Le Pi 5 et beaucoup de mini-PC sobres saturent vite dès que le contexte grossit ou que l’UI + le modèle se disputent la RAM. La chaleur, l’alimentation sous-dimensionnée et la carte SD lentes aggravent le ressenti « trop lent ».

Si votre structure doit servir une équipe au quotidien, budgétez un autre étage : PC GPU, ou location (serveur GPU France). Le petit matériel reste excellent comme première marche et comme objet de médiation.

Pas à pas : de la boîte fermée à la démo FabLab

1

Choisir et préparer le matériel

Décidez Pi 5 (pédagogie monocarte, budget serré) ou mini-PC (plus de marge RAM/stockage). Prévoyez alimentation officielle ou équivalente fiable, refroidissement actif, et stockage rapide si possible. Flashez une image Linux à jour, faites les mises à jour système, créez un utilisateur non privilégié pour les démos. Étiquetez physiquement la machine et notez son inventaire FabLab. Vérifiez que le réseau local de l’atelier permet un SSH confortable depuis le poste formateur sans exposer la machine sur Internet grand public ni sur le Wi-Fi invité ouvert.

2

Installer le runtime compatible ARM ou x86

Consultez la documentation du jour d’Ollama (ou runtime choisi) pour votre architecture. Installez uniquement depuis les sources officielles. Lancez une commande de version pour confirmer le binaire. Sur Pi, méfiez-vous des tutoriels anciens prévus pour Pi 4 : les paquets et accélérations diffèrent. Si une fonction GPU/NPU est documentée pour votre carte, suivez le guide éditeur ; sinon assumez une inférence CPU et des modèles plus petits. Documentez la version installée dans un README collé au châssis (fichier texte sur le bureau).

3

Tirer un premier modèle tout petit

Choisissez un tag clairement dans l’ordre 1–4B (par exemple une variante type Gemma 4 E2B ou Qwen3 1.7B — recopiez le tag exact du catalogue du jour). Lancez le pull, surveillez l’espace disque et la température. Une fois chargé, posez une question d’une ligne en français. Notez le ressenti avec le vocabulaire qualitatif du tableau. Si c’est déjà « trop lent pour du chat fluide » sur un prompt court, n’ajoutez pas une UI lourde ni un modèle plus gros : allégez encore ou changez de machine.

4

Constituer la banque de tests qualitatifs

Utilisez le bloc prompt de ce tutoriel comme protocole commun. Enregistrez pour chaque test : date, tag exact du modèle, machine (Pi 5 ou mini-PC), et ressenti avec le vocabulaire du tableau. Faites passer un collègue non technicien sur la même série : son impatience compte plus qu’un chronomètre narcissique. Interdisez-vous d’écrire des tok/s dans le compte rendu public de l’atelier. Si vous chronométrez pour vous, gardez les chiffres dans un carnet interne clairement daté et non brandés comme « mesure IAHDF labo ». Relisez à voix haute le ressenti avant de le noter : « utilisable », « lent mais pédagogique » ou « trop lent » suffisent pour décider.

5

Préparer la démo pédagogique de huit minutes

Script type : une minute de contexte (pourquoi local), deux minutes sur le pull et la liste des modèles déjà faits hors session, trois minutes de prompts courts en live, deux minutes de limites honnêtes. Préparez un plan B si la machine throttle (modèle encore plus petit déjà téléchargé, ou courte vidéo de secours montrant une session précédente). Placez le Pi sous le vidéoprojecteur d’un FabLab à Tourcoing ou d’une MJC amiénoise : le public doit voir le matériel physique, pas seulement une fenêtre de navigateur. Chronométrez la démo une fois à blanc pour éviter de déborder et de perdre le public.

6

Décider de la suite (rester petit ou monter en gamme)

Après deux ateliers, tranchez clairement : le Pi ou le mini-PC suffit-il à vos objectifs de médiation ? Sinon, planifiez un PC GPU via installer Ollama / LM Studio ou une location GPU France. Nettoyez les comptes, mettez à jour le système, et archivez le journal qualitatif. Ne laissez jamais un modèle et une interface exposés sans mot de passe sur le Wi-Fi invité de la structure. La meilleure démo reste celle qui se termine sans incident de données ni machine oubliée allumée. Notez la décision dans le carnet FabLab pour la prochaine session.

Angle HdF : faire vivre le sujet en FabLab

Proposez un challenge « plus petit modèle utile » : chaque binôme choisit un tag léger et un usage d’atelier réel (fiche machine, règlement intérieur fictif, message adhérents). Le jury n’écoute pas les promesses de débit : il écoute si la réponse arrive avant que le public décroche, et si le discours sur les limites est clair.

Mutualisez les cartes SD images « atelier IA » entre antennes régionales, avec un README identique. IAHDF peut accompagner la posture pédagogique ; le matériel reste celui de votre structure. L’indépendance éditoriale vaut aussi pour les marques de monocartes et de mini-PC : citez ce que vous avez vraiment sous la main.

Gouvernance légère de la mini-machine

Même un Pi mérite un responsable : qui met à jour, qui tire les modèles, qui autorise l’accès SSH. Tenez une liste des tags installés et une date de revue. Effacez les conversations de démo après la session si l’UI en conserve. En cas de prêt de la machine à une autre association de la région, réinstallez plutôt que de transmettre des historiques.

Questions fréquentes

Une IA sur un Raspberry Pi, c’est possible ?

Oui, avec de petits modèles (ordre 1–4B) et des usages calmes : texte court, démo pédagogique, reformulation. Ce n’est en général pas adapté à un chat fluide multi-tours ou à de gros documents. Le Pi 5 améliore franchement l’expérience par rapport aux générations précédentes, à condition d’alimenter et refroidir correctement. Jugez sur votre exemplaire avec un vocabulaire qualitatif, sans chiffres de débit inventés.

Pi 5 ou mini-PC : que choisir ?

Le Pi 5 excelle pour la médiation et le budget d’entrée. Le mini-PC x86 offre souvent plus de RAM et de confort si vous ajoutez une interface ou des sessions plus longues. Pour un FabLab qui fait surtout de la démo, le Pi suffit souvent. Pour un usage quotidien d’une petite équipe, le mini-PC — ou mieux, une machine GPU — sera plus sage.

Quels modèles utiliser ?

Des tags légers du catalogue du jour, dans l’esprit Gemma 4 E2B, Qwen3 1.7B et équivalents 1–4B. Recopiez le nom exact depuis la source officielle. Testez le français sur vos prompts d’atelier. Si le ressenti est déjà limite sur un prompt court, n’escaladez pas la taille : changez d’usage ou de matériel.

Pourquoi vous ne donnez pas de tok/s ?

Parce que des débits présentés comme « mesures IAHDF » sans protocole reproductible tromperaient les lecteurs. Les résultats varient trop selon l’image système, la quantification, la température et le stockage. Nous préférons des ordres de grandeur qualitatifs et une méthode pour que vous notiez votre ressenti. C’est moins spectaculaire, plus honnête.

Que faire après ce tutoriel ?

Montez une démo de huit minutes en FabLab, tenez un journal qualitatif, puis décidez si vous restez sur petit matériel ou si vous passez à Ollama sur un PC, LM Studio, ou location GPU France. Pour pratiquer avec d’autres structures HdF, utilisez l’agenda et l’inscription ci-dessous.

Pour aller plus loin

Rencontres en Hauts-de-FranceAgenda des ateliers IAHDFSuivre les ressources et sessionsInscription à la communauté
Cette ressource vous a-t-elle aidé ?

Pour aller plus loin

Tutoriel Installer Ollama sur Windows, Mac ou Linux et lancer son premier modèle 14 min · Équipe IAHDF Tutoriel LM Studio : l'IA locale sans ligne de commande (tuto débutant) 14 min · Équipe IAHDF Tutoriel Louer un serveur GPU en France pour héberger son IA (OVHcloud, Scaleway…) 20 min · Équipe IAHDF