Mon IA locale peut-elle lire une facture ? Souvent oui, avec un modèle multimodal (vision-langage) capable d’analyser une image et de répondre en texte. Gemma, Qwen-VL et d’autres familles évoluent vite : vérifiez la disponibilité réelle sur Ollama et la documentation du jour. Ce tutoriel montre comment installer, prompting d’extraction, sortie structurée, protocole de test sur factures fictives, et limites — pour une asso de Roubaix, un artisan à Beauvais ou un service facturation de collectivité.
Modèles vision : vérifier la dispo du jour
Les noms de modèles changent, les tags Ollama aussi. Avant tout atelier, listez les modèles vision réellement tirables sur votre machine via la documentation Ollama et les pages des familles concernées (par exemple variantes vision de Gemma ou Qwen-VL). Ne promettez pas un modèle absent du registre. Notez la taille approximative et le prérequis matériel indiqué par l’éditeur ou la communauté — sans recopier des VRAM de labo non vérifiées chez vous.
Un GPU avec mémoire dédiée confortable est souvent recommandé pour ces modèles ; le CSV pédagogique évoque des ordres de grandeur courants dans les guides, à confirmer sur votre configuration. En CPU, attendez-vous à une lenteur qui peut rendre l’atelier pénible.
Pourquoi lire en local
Une facture contient noms, adresses, IBAN parfois, montants, mentions légales. L’envoyer à un OCR cloud ou à une IA distante peut être interdit par votre charte. Un modèle local garde l’image sur la machine. Cela aide sous l’angle de la maîtrise des données, sans dispenser de sécuriser le poste et les dossiers.
Dans un entrepôt à Hénin-Beaumont qui scanne des bons de livraison, ou un cabinet comptable libéral à Compiègne, le local permet un bac à sable maîtrisé. La validation humaine reste obligatoire avant toute écriture comptable.
Constituez dès le départ un glossaire des mentions fréquentes sur vos factures fournisseurs (acomptes, escomptes, frais de port). Le modèle confond volontiers ces libellés. Votre glossaire sert autant à former les humains qu’à enrichir le prompt sans inventer de montants.
Séparez clairement les postes de travail : machine d’extraction, machine de validation, système comptable. Moins il y a de raccourcis « je copie-colle direct dans la paie », plus vous dormez tranquille. Cette séparation est organisationnelle avant d’être technique.
En atelier à Roubaix, faites travailler deux binômes sur le même lot avec deux prompts différents, puis comparez les écarts champ par champ. L’exercice montre que le prompt est un levier aussi fort que le choix du modèle, sans aucun score marketing à brandir.
Installer et exposer le modèle
Avec Ollama (ou équivalent), tirez le modèle vision choisi, vérifiez qu’il accepte une image en entrée dans votre interface (Open WebUI, CLI, API locale). Les commandes exactes dépendent des tags du jour. Testez d’abord avec une photo neutre (une page imprimée de démonstration), pas avec la facture d’un fournisseur réel.
# Vérifiez le nom de tag exact sur la doc Ollama du jour # Exemple de principe (le tag peut différer) : ollama pull qwen2.5-vl # ou autre modèle vision listé comme disponible chez vous # Prompt d’extraction à coller avec l’image (facture fictive) : Tu analyses une image de facture. Extrais uniquement ce que tu lis. Si un champ est illisible, écris null. N’invente aucun montant ni SIRET. Réponds en JSON avec les clés : fournisseur, date, numero_facture, total_ttc, total_ht, tva, devise, iban. Ajoute une clé "warnings" (liste) pour les doutes.
Prompts d’extraction : discipline
Interdisez l’invention. Demandez le null plutôt qu’une hypothèse. Séparez lecture et raisonnement : d’abord les champs, ensuite éventuellement une remarque sur une incohérence visible (total qui ne matche pas les lignes) — toujours signalée comme hypothèse. Pour les tableaux, demandez une liste de lignes avec description et montant, sans compléter les cases floues.
Pour une photo de local ou de matériel (inventaire associatif), changez le schéma : objets visibles, état apparent, texte lu sur les étiquettes. Même discipline : pas de roman.
Sortie JSON et suite de chaîne
Une sortie structurée facilite le contrôle et l’import. Elle n’est pas magique : le modèle peut produire un JSON invalide. Ajoutez une validation (script ou nœud n8n) qui refuse le fichier si le JSON casse. Pour un RAG documentaire automatisé plus large, voyez n8n et Qdrant ; ici l’objet est l’image ponctuelle.
| Champ | Erreur typique du modèle | Contrôle humain |
|---|---|---|
| Montant TTC | Confusion HT / TTC | Recalcul ou lecture directe |
| Date | Format ambigu jour/mois | Comparer au tampon / contexte |
| IBAN | Caractères proches mal lus | Ne jamais payer sans contrôle |
| Fournisseur | En-tête publicitaire pris pour raison sociale | Vérifier SIRET / contrat |
Précision mesurée : protocole honnête
Constituez un lot de test : par exemple une vingtaine de factures fictives ou anonymisées avec accord, dont vous connaissez la vérité (tableur de référence). Faites tourner l’extraction. Comptez champ par champ les correspondances exactes. Publiez vos résultats en interne seulement si la méthode est claire. N’empruntez pas un « taux » vu dans une pub. Le plan pédagogique « 20 factures test » désigne cette méthode, pas un score magique fourni ici.
Variez qualités de scan, photos de téléphone, tableaux, mentions manuscrites. Vous découvrirez les angles morts de votre modèle et de votre prompt.
Sécurité et comptabilité
Jamais de paiement automatique déclenché par une extraction IA. Séparez lecture et action. Limitez les accès au dossier d’images. Journalisez qui a lancé une extraction. Principes RGPD : minimisation (ne gardez pas toutes les photos indéfiniment), finalité claire, machine maîtrisée, sous-traitance d’hébergement clarifiée si le serveur n’est pas à vous.
Limites : OCR classique vs modèle vision
Un OCR classique reste utile pour du texte imprimé simple. Un modèle vision se justifie pour mise en page complexe, mélange texte/image, ou consignes en langage naturel. Parfois, chaîner OCR puis LLM texte est plus stable. Testez les deux approches sur votre lot avant de standardiser.
Pas à pas : de l’image à l’extraction contrôlée
Créer le lot de test et la vérité terrain
Préparez une vingtaine de documents fictifs ou dûment autorisés, avec qualités de scan variées. Saisissez dans un tableur les champs attendus (fournisseur, dates, montants, numéros). Numérotez les fichiers de façon stable. Ce tableur est votre seule référence de qualité : sans lui, vous discuterez d’impressions. Dans une asso, faites valider le protocole par le trésorier même si les factures sont fictives : le geste de contrôle compte autant que l’outil. Archivez le lot dans un dossier clairement marqué « test », hors production. Prenez le temps de documenter ce point dans votre cahier d’atelier avant de passer à l’étape suivante.
Installer le modèle vision disponible
Consultez la liste Ollama et la documentation du jour pour les tags réellement tirables. Tirez un modèle multimodal compatible avec votre matériel. Vérifiez qu’une image peut être fournie via CLI ou Open WebUI. Documentez le tag exact et la date du test. Si le modèle ne tient pas sur la machine, choisissez une variante plus légère ou reportez l’atelier plutôt que d’improviser un envoi cloud contraire à la charte. Notez aussi la latence ressentie sur une image neutre avant d’attaquer le lot complet.
Calibrer le prompt d’extraction
Utilisez le prompt JSON fourni dans ce tutoriel comme base. Testez sur trois images représentatives. Ajustez les clés à votre besoin réel (ajout ou retrait de champs). Interdisez l’invention et exigez null en cas de doute. Ajoutez des exemples de warnings attendus. Figez ensuite le prompt dans un fichier versionné pour que tous les essais du lot utilisent la même consigne — sinon votre mesure comparative ne veut rien dire et vous ne pourrez pas améliorer le processus. Prenez le temps de documenter ce point dans votre cahier d’atelier avant de passer à l’étape suivante.
Lancer le lot et comparer champ à champ
Traitez les vingt documents avec le prompt figé. Pour chaque champ, marquez exact, erreur ou null dans le tableur. Calculez vos taux en interne uniquement, sans les publier comme argument marketing. Identifiez les trois erreurs les plus fréquentes. Adaptez le prompt ou la qualité de scan, puis rejouez seulement les cas échoués. Ne publiez pas de classement entre modèles : gardez le résultat pour décider si l’outil est utile à votre procédure comptable réelle. Prenez le temps de documenter ce point dans votre cahier d’atelier avant de passer à l’étape suivante.
Insérer la validation humaine dans le processus
Définissez qui relit avant import comptable ou paiement, avec un rôle nommé et un remplaçant. Préparez un écran ou un tableur de validation qui montre image et JSON côte à côte. Interdisez tout paiement automatique déclenché par l’extraction. Formez sur les cas IBAN, totaux et dates ambiguës. Dans une mairie, alignez-vous sur le circuit de signature existant : l’IA ne crée pas un circuit parallèle fantôme qui court-circuite le contrôle interne. Prenez le temps de documenter ce point dans votre cahier d’atelier avant de passer à l’étape suivante.
Durcir sécurité et archivage
Chiffrez ou protégez le dossier d’images si le contexte l’exige, définissez une durée de conservation, restreignez les comptes capables de lancer une extraction. Décidez si les JSON d’extraction se conservent, et où. Journalisez les traitements sans y coller inutilement des pièces complètes. Reliez la pratique à données sensibles. Si vous devez enchaîner une indexation documentaire texte plus large, explorez RAG n8n Qdrant après coup, pas comme raccourci pour valider une facture. Prenez le temps de documenter ce point dans votre cahier d’atelier avant de passer à l’étape suivante.
Atelier d’une heure : photo de tableau
En plus des factures, faites photographier un tableau blanc d’ordre du jour à Arras. Demandez la liste des points lus. Comparez à la photo. Les participants voient immédiatement hallucinations et oublis. C’est souvent plus parlant qu’un discours sur les limites.
Questions fréquentes
Mon IA locale peut-elle lire une facture ?
Oui avec un modèle vision-langage correctement installé et un prompt d’extraction discipliné. La qualité dépend du scan, du modèle, de la langue et de la mise en page. Vous devez mesurer sur un lot de test plutôt que croire une démo en ligne. Et la lecture n’autorise pas le paiement sans humain habilité. Cadrez d’abord le processus comptable et les droits d’accès, ensuite seulement l’outil, pour éviter qu’une expérimentation enthousiaste ne contourne vos règles internes. Prenez le temps de documenter ce point dans votre cahier d’atelier avant de passer à l’étape suivante.
Gemma 4 ou Qwen VL : lequel choisir ?
Celui disponible, maintenu, et qui tourne sur votre matériel au moment de l’installation. Les familles évoluent vite ; les tags aussi. Ce tutoriel ne publie pas de benchmark. Faites un match sur votre lot de vingt documents et gardez le vainqueur local, documenté, avec date de test et prompt figé. Revisitez après une mise à jour majeure du modèle ou d’Ollama. Changez de modèle seulement si le gain sur votre lot est clair et reproductible, pas sur une impression de salon.
Faut-il 12 à 24 Go de VRAM ?
Beaucoup de guides communautaires situent les modèles vision confortables dans des ordres de grandeur de mémoire dédiée élevés, mais le besoin réel dépend du modèle, de la quantification et de la résolution des images. Vérifiez la fiche du modèle et testez chez vous. Ce texte ne remplace pas une mesure sur votre GPU. Si le matériel manque, réduisez la taille de modèle, limitez la résolution, ou réservez l’OCR classique pour certains documents imprimés simples. Prenez le temps de documenter ce point dans votre cahier d’atelier avant de passer à l’étape suivante.
Le JSON garantit-il l’absence d’erreur ?
Non. Le JSON structure la réponse ; il peut contenir des valeurs fausses parfaitement bien formées. Ajoutez une validation de schéma et un contrôle humain systématique avant tout usage comptable. Un champ null est préférable à un chiffre inventé. Formez les relecteurs à chercher les erreurs « propres » autant que les plantages de format. Un JSON valide n’est qu’un format, jamais une preuve de vérité terrain. Prenez le temps de documenter ce point dans votre cahier d’atelier avant de passer à l’étape suivante.
Comment prolonger le parcours ?
Stabilisez votre protocole de test et votre circuit de validation humaine, puis explorez les outils côté chat (Open WebUI outils) si besoin d’actions répétées. Pour une veille documentaire automatisée sur des textes, n8n et Qdrant. Les ateliers IAHDF : agenda et inscription. Boussole données : ne pas confier n’importe quoi. Avancez par lots mesurés, pas par promesses de « zéro erreur ». Prenez le temps de documenter ce point dans votre cahier d’atelier avant de passer à l’étape suivante.
Pour aller plus loin
Vous savez installer un modèle vision, extraire sans inventer, et mesurer chez vous. C’est la base d’une IA documentaire honnête. Retrouvez les sessions sur l’agenda, inscrivez-vous sur l’inscription, et gardez les données à ne pas confier à portée de main.
