Puis-je parler à mon IA locale ? Oui, à condition de brancher une dictée (STT) et éventuellement une synthèse (TTS) qui restent sous votre contrôle. Open WebUI peut s’appuyer sur Whisper en local pour transformer la parole en texte, puis lire la réponse à voix haute selon les modules disponibles. Ce tutoriel détaille les composants, les réglages, la qualité en français, la latence, et les gestes RGPD autour de l’audio — utile en atelier d’accessibilité à Lens ou en permanence associative à Saint-Quentin.
Les composants de la chaîne voix
Trois briques : capture micro (navigateur ou application), reconnaissance vocale locale (souvent Whisper ou faster-whisper selon votre stack), et synthèse vocale locale pour lire la réponse. Le modèle de langage reste celui déjà configuré dans Open WebUI. La voix n’est qu’une porte d’entrée et de sortie.
Un GPU dédié est souvent conseillé pour fluidifier Whisper sur des durées longues, mais ce n’est pas une obligation absolue pour des essais courts sur CPU : mesurez sur votre machine. Ce tutoriel n’invente pas de chiffre de VRAM de laboratoire : lisez les prérequis du modèle et de votre version d’outil.
Dans un espace public numérique de Lens, prévoyez un casque individuel plutôt qu’un haut-parleur : la dictée d’un usager ne doit pas devenir audible pour toute la file d’attente. La voix locale résout une partie du trajet des données ; elle ne résout pas l’indiscrétion de salle. Ajoutez ce point à la checklist d’ouverture de permanence, au même titre que le nettoyage de session navigateur entre deux personnes.
Documentez pour les animateurs la différence entre « Whisper local branché » et « dictée du système d’exploitation qui envoie peut-être ailleurs ». Les usagers confondent souvent les deux. Une phrase d’accueil claire évite les mauvaises surprises et les plaintes légitimes. Affichez-la près du poste, en français simple, sans jargon technique inutile.
Si vous animez un atelier seniors à Amiens, prévoyez un temps d’échauffement : dire son prénom, une commune, un chiffre. Cela détend, teste le micro, et montre immédiatement les homophones. Gardez ces enregistrements d’échauffement hors de toute sauvegarde longue : ils n’ont de valeur que pendant la session.
Pourquoi la voix locale change l’atelier
Dans un atelier seniors à Amiens, la dictée réduit la fatigue de frappe. Dans un entrepôt où les mains sont prises, une consigne orale courte peut préparer une checklist. Dans un cabinet médical de ville, la tentation est forte — et le risque aussi : l’audio peut contenir des données de santé. Cadrez les usages avant le branchement technique.
La voix locale évite d’envoyer l’enregistrement vers un service cloud de dictée. Cet avantage disparaît si vous activez un STT distant « pour aller plus vite » sans le dire aux participants. Transparence : dites clairement où l’audio est traité.
Réglages dans Open WebUI
Selon les versions, Open WebUI expose des options audio, des endpoints STT/TTS, ou des intégrations à configurer dans l’administration. Les menus et tags exacts évoluent : ouvrez la documentation du jour pour votre numéro de version. Principe : pointer vers un service Whisper local (URL interne), choisir la langue française, tester un micro connu.
Désactivez l’envoi audio vers des prestataires non validés. Vérifiez les permissions micro du navigateur. Sur un poste partagé d’espace public numérique, prévoyez un rappel oral : « le micro s’arrête quand vous quittez la session ».
| Paramètre | Question à trancher | Effet concret |
|---|---|---|
| Lieu du STT | Local uniquement ou service distant ? | Trajet des données audio |
| Langue | Français forcé ou auto-détect ? | Noms propres et accents |
| Taille de modèle Whisper | Petit / moyen / grand ? | Latence vs détail |
| TTS | Activé ou texte seul ? | Confort et bruit de salle |
Qualité en français : tester vraiment
Préparez phrases de test : noms de communes (Wattrelos, Maubeuge, Abbeville), sigles locaux, chiffres et horaires. Dictez lentement, puis à vitesse normale. Notez les erreurs récurrentes. Constituez un petit lexique de corrections pour les animateurs. N’affirmez pas un « taux de précision » inventé : mesurez sur vos enregistrements.
Les accents des Hauts-de-France, le bruit de fond d’une salle municipale, un micro de conférence médiocre : tout cela dégrade le signal. Investissez d’abord dans un micro correct et un local calme avant d’acheter du matériel GPU supplémentaire.
Latence : ce que les usagers ressentent
La chaîne complète ajoute : capture, transfert local, transcription, génération LLM, éventuellement TTS. Expliquez aux participants qu’un silence de quelques secondes n’est pas un plantage. Affichez un indicateur « transcription en cours » si l’interface le permet. Pour des réponses longues, proposez le mode texte d’abord, TTS ensuite.
Si la latence gêne l’atelier, réduisez la taille du modèle Whisper, raccourcissez les tours de parole, ou réservez la voix à la dictée de la question seulement. Le TTS peut attendre.
L’audio est une donnée
Un enregistrement peut révéler une identité, un état de santé, une situation sociale. Minimisez : ne gardez pas les fichiers audio si seule la transcription utile doit rester. Sécurisez les dossiers temporaires. Sur un poste d’espace public, effacez la session entre deux usagers. Principes RGPD : minimisation, accès limité, pas de sous-traitance audio cachée.
# Exemple de principe — vérifier la doc Whisper / faster-whisper du jour # Ne collez pas d’audio réel sensible sur une machine non maîtrisée. # 1) Transcrire un fichier court (CPU ou GPU selon install) # faster-whisper ou whisper CLI, selon votre environnement : whisper entretien_demo.wav --language fr --model small --output_format txt # 2) Contrôler le texte produit avant tout envoi à un LLM # Lire entretien_demo.txt, corriger noms propres, supprimer tout passage hors sujet. # 3) Dans Open WebUI : pointer le STT vers votre endpoint local # (URL, clé interne éventuelle, langue fr) — menus selon version. # 4) Test vivant : dicter # « Prépare l’ordre du jour de la réunion de l’association à Arras : # accueil, budget prévisionnel, date de la prochaine permanence. »
Synthèse vocale : confort et étiquette de salle
Le TTS local aide malvoyants et situations mains libres. Réglez le volume pour ne pas saturer une salle polyvalente. Proposez un casque sur les postes individuels. Choisissez une voix française disponible dans votre stack ; testez l’intelligibilité plutôt que le « naturel » marketing. Laissez toujours un moyen de couper le son rapidement.
Au-delà du chat : réunions longues
Pour transcrire une réunion entière en local, le tutoriel transcription locale avec faster-whisper approfondit fichiers longs, diarisation et résumé. Ici, l’objectif est le dialogue interactif dans Open WebUI. Ne transformez pas un atelier découverte en marathon d’enregistrement sans consentement des présents.
Pas à pas : activer la voix locale
Préparer le poste et le micro
Choisissez un ordinateur maîtrisé, casque micro testé la veille, navigateur à jour, et un compte Open WebUI de test distinct de la production. Fermez les applications qui capturent le micro en parallèle (visio, autre dictée système). Créez un dossier temporaire pour les essais audio fictifs, hors synchronisation cloud automatique. Dans une médiathèque ou une mairie, prévoyez une salle assez calme : la qualité du signal prime sur la taille du modèle. Notez le nom du micro utilisé pour reproduire les conditions d’atelier la semaine suivante.
Installer ou vérifier Whisper local
Selon votre stack, installez Whisper, faster-whisper, ou le service déjà prévu par votre déploiement Open WebUI, en suivant la documentation de version pour les dépendances. Faites un essai en ligne de commande sur un fichier wav de démonstration non sensible, en français forcé. Confirmez la latence ressentie et l’encodage UTF-8 du texte produit. Gardez ce banc d’essai pour comparer après chaque mise à jour. Si un GPU est disponible, mesurez l’écart avec le mode CPU sur le même fichier, sans en faire un benchmark public ni un chiffre inventé.
Brancher le STT dans Open WebUI
Dans l’administration, repérez les réglages audio / STT (libellés selon version — vérifiez la documentation du jour). Pointez vers l’endpoint local et désactivez clairement toute option cloud non validée par votre structure. Enregistrez, rechargez l’interface utilisateur, autorisez le micro dans le navigateur pour le bon site (URL interne ou https local). Documentez le chemin de menus pour les animateurs suivants, avec date et numéro de version, afin d’éviter la chasse aux captures d’écran obsolètes trouvées sur un blog. Prenez le temps de documenter ce point dans votre cahier d’atelier avant de passer à l’étape suivante.
Tester le français et les noms locaux
Dictez cinq phrases préparées avec toponymes des Hauts-de-France, chiffres et horaires de permanence. Corrigez à la main la transcription si besoin avant d’envoyer au modèle, pour séparer l’erreur STT de l’erreur LLM. Observez si le modèle reçoit bien le texte corrigé. Constituez une fiche « erreurs fréquentes » pour l’atelier (noms, sigles, homophones). Si les noms propres échouent trop, allongez l’élocution ou épéléz une fois, plutôt que d’inventer un score de qualité marketing à afficher aux participants. Prenez le temps de documenter ce point dans votre cahier d’atelier avant de passer à l’étape suivante.
Ajouter le TTS avec étiquette de salle
Activez la synthèse vocale locale si elle est disponible dans votre stack. Testez volume, débit et intelligibilité avec un casque et, séparément, avec un petit haut-parleur. Apprenez aux usagers à couper le son en un geste visible. Décidez si le TTS est actif par défaut ou sur demande : dans un open space de collectivité, le mode sur demande évite la pollution sonore et les oreilles indiscrètes. Vérifiez aussi que le TTS ne lit pas automatiquement des contenus sensibles affichés à l’écran derrière l’utilisateur.
Cadre données et clôture de session
Rédigez trois règles affichées près du poste : où l’audio est traité, durée de conservation des fichiers, effacement entre deux usagers. Formez les animateurs à quitter proprement la session navigateur et à vider le dossier temporaire. Faites un exercice d’incident : audio sensible dicté par erreur — procédure d’effacement et d’information interne. Reliez ce cadre à données à ne pas confier et, pour les longs fichiers de réunion, à transcription de réunions plutôt qu’au simple chat vocal d’Open WebUI. Prenez le temps de documenter ce point dans votre cahier d’atelier avant de passer à l’étape suivante.
Accessibilité : promesse et limites
La voix aide, mais ne remplace pas une stratégie d’accessibilité complète (contrastes, clavier, alternatives). Proposez toujours le mode texte. Laissez du temps. N’imposez pas la dictée à quelqu’un qui préfère taper. En Maison de l’IA, la voix est une option parmi d’autres, présentée sans injonction.
Questions fréquentes
Puis-je parler à mon IA locale ?
Oui, si vous branchez une reconnaissance vocale locale et que votre interface l’expose correctement. Open WebUI, selon les versions et modules, permet de dicter puis d’envoyer le texte au modèle local. La synthèse vocale est un confort supplémentaire, pas une obligation pour démarrer. Le prérequis réel est une machine maîtrisée, un micro décent, une règle claire sur le sort des enregistrements, et une phrase d’accueil honnête pour les usagers. Sans cela, restez au clavier : mieux vaut une frappe lente qu’un audio mal cadré dans une permanence.
Whisper cloud et Whisper local, quelle différence pour les données ?
En local, l’audio peut rester sur votre machine ou votre réseau maîtrisé, ce qui favorise la minimisation des transferts vers des tiers. Un service cloud de dictée implique un destinataire supplémentaire et des conditions à lire avant l’atelier. Le mot « Whisper » seul ne dit pas où part le son : c’est votre configuration qui compte, y compris les sauvegardes et synchros de dossiers. Dites-le explicitement aux participants, et montrez le menu où l’endpoint local est déclaré, pour ancrer la confiance dans le réel plutôt que dans le slogan.
Faut-il un GPU ?
Souvent conseillé pour un confort fluide, surtout si plusieurs usagers enchaînent des dictées longues dans la même demi-journée. Des essais courts sur CPU restent possibles selon la taille de modèle et la patience du public. Mesurez la latence chez vous plutôt que de croire un chiffre de forum non daté. Si le budget matériel est limité, dictez des questions courtes, désactivez le TTS, et réservez le GPU mutualisé aux créneaux où la voix apporte vraiment un gain d’accessibilité pour les personnes qui en ont besoin.
La dictée est-elle fiable pour un compte rendu officiel ?
Non sans relecture humaine attentive. Les noms, chiffres, engagements et formules doivent être vérifiés hors de la chaîne vocale. Pour une réunion formelle de conseil, suivez plutôt un protocole de transcription dédié comme dans transcription locale, avec validation du secrétariat et règles de conservation. Le chat vocal d’Open WebUI sert l’interaction pédagogique ou l’accessibilité ponctuelle, pas l’acte authentique ni le procès-verbal. Présentez clairement cette limite en ouverture d’atelier pour éviter les malentendus avec les élus ou le bureau.
Où pratiquer en présentiel ?
Les ateliers IAHDF permettent de tester micro, latence, phrase d’accueil et cadre données avec un médiateur, sur des scénarios fictifs adaptés aux Hauts-de-France. Consultez l’agenda et l’inscription pour les sessions près de chez vous. Pour prolonger sur l’extension d’outils texte, voyez outils Open WebUI. Pour la discipline des contenus, données à ne pas confier reste la boussole à afficher près du poste de dictée, lisible avant même d’ouvrir le micro. Prenez le temps de documenter ce point dans votre cahier d’atelier avant de passer à l’étape suivante.
Pour aller plus loin
Vous avez une chaîne voix locale modeste, testée en français, avec des règles d’effacement. C’est déjà plus solide qu’une démo cloud improvisée. Prochaines sessions sur l’agenda, inscription via l’inscription, et approfondissement réunions avec faster-whisper en local.
