Douze assistants, douze épreuves identiques, aucune médaille inventée : ce grand test IAHDF de septembre 2026 décrit un protocole commun, des familles d’outils, un tableau qualitatif, des scènes concrètes en Hauts-de-France, et surtout ce que ces essais ne prouvent pas. Vous pourrez le refaire chez vous avec les prompts publiés, sans croire un podium viral. IAHDF n’est rémunéré par aucun éditeur, refuse les classements chiffrés trompeurs, et privilégie la lecture critique pour les structures de la région.
Pourquoi un grand test sans podium
Chaque semaine, un classement « meilleure IA » circule. Il change avec une mise à jour, une démo filmée, un benchmark anglais. Pour une association à Roubaix, une TPE à Arras ou un agent dans une mairie de l’Avesnois, ce bruit ne répond pas à la question utile : laquelle m’aide vraiment sur mon courriel, mon PDF public, mon tableur de suivi — sans coller de dossier nominatif ?
Ce texte propose autre chose. Un protocole commun. Des épreuves rédigées en entier. Un tableau qualitatif par familles d’outils. Des scènes locales. Une section explicite sur ce que le test ne prouve pas. Et une méthode pour le refaire. Les fiches individuelles (GPT-6 Astra, Claude Opus, Gemini, Le Chat, Copilot, etc.) restent le lieu du détail modèle par modèle ; ici, on lit la grille.
IAHDF ne touche rien de ces services. Aucun classement payant. Aucun pourcentage inventé. Daté septembre 2026 : les interfaces bougent ; la méthode doit rester.
Les douze assistants, en familles
Pour éviter le faux classement nominal, nous regroupons les outils en familles. Une famille n’est pas une note : c’est un mode d’accès et un cadre de données. Les noms commerciaux cités sont des exemples de septembre 2026, pas une liste exhaustive ni un engagement d’exhaustivité.
Famille « chat généraliste cloud » : ChatGPT (OpenAI), Claude (Anthropic), Gemini (Google), Le Chat (Mistral), Grok (xAI), DeepSeek côté interface grand public. Famille « assistant branché sur une suite » : Microsoft Copilot près de Windows / Office. Famille « moteur de réponses sourcées » : Perplexity et, selon les usages, Gemini ou Le Chat avec recherche. Famille « assistant dans les messageries » : Meta AI. Famille « accès gratuit / alternatif » : versions gratuites, Duck.ai, Lumo et équivalents — détaillés aussi dans les IA gratuites.
Cette grille sert le tableau plus bas. Elle empêche de comparer une réponse Copilot dans Word comme si c’était le même geste qu’un collage dans un chat anonyme. Le cadre compte autant que la prose.
Le protocole : mêmes épreuves, même consigne
Règle numéro un : la consigne ne change pas d’un onglet à l’autre. On ne « aide » pas un outil en reformulant. On copie-colle. On note ce qui manque, ce qui est inventé, ce qui est utilisable après correction humaine. Trois passes sur les épreuves factuelles quand c’est pertinent (quiz local), une passe sur les épreuves de rédaction si le texte est stable.
Ce que le protocole exige : français, vouvoiement quand le public est pro ou institutionnel, faits listés explicitement, interdiction d’inventer. Ce que le protocole refuse : notes sur 10 inventées pour ce papier, moyennes de messages figés (ils bougent), prix au centime, pourcentages d’écart « scientifiques » sans mesure publiée ici.
Ce qu’on ne peut pas conclure d’un seul run : qu’un modèle « gagne 2026 », qu’il « connaît » votre commune, qu’il est sûr pour un dossier RH, qu’il restera le même en décembre. On peut conclure : sur cette consigne, à cette date, tel type d’outil a produit un brouillon plus ou moins corrigible pour tel usage.
Les douze épreuves, rédigées en entier
Ci-dessous, les consignes exactes utilisées. Remplacez les crochets par vos faits. Pour le quiz Hauts-de-France et le ch’ti, voir aussi connaissance régionale et test ch’ti / picard.
Je suis [rôle] dans [structure] à [ville des Hauts-de-France]. Rédige un courriel de [nombre] mots maximum pour [destinataire / public]. Objectif : [ce que la personne doit comprendre ou faire]. Ton : simple, vouvoiement, sans jargon marketing. Faits autorisés uniquement : - [fait 1] - [fait 2] - [fait 3] N’invente aucun chiffre, date, nom, aide, délai ou motif. Si une information manque, pose une question avant d’écrire.
Voici le texte (ou les extraits) d’un document public régional. Résume en [8–12] puces : 1) décisions ou propositions principales ; 2) montants seulement s’ils apparaissent dans le texte ; 3) calendrier seulement s’il apparaît ; 4) points ambigus ou absents (dis « non précisé »). Interdiction d’ajouter une information hors texte. Cite entre guillemets une phrase clé du document pour chaque décision importante. Document : --- [coller le texte public] ---
Réponds aux 10 questions suivantes sur les Hauts-de-France. Pour chaque réponse : (a) ta réponse courte ; (b) ton niveau de certitude (faible / moyen / élevé) ; (c) si tu n’es pas sûr, écris « je ne sais pas » plutôt qu’inventer. N’invente pas de maire, de date de fête, de nom de quartier ou de montant d’aide. Questions : 1) [question piège vérifiable] 2) … 10) …
Voici un petit problème logique en français (pas de recherche web nécessaire). Explique ton raisonnement étape par étape, puis donne la réponse finale clairement séparée. Si le problème est sous-spécifié, dis ce qui manque au lieu d’inventer une hypothèse cachée. Problème : [énoncé]
Voici un tableau CSV anonymisé (suivi d’inscriptions / stocks / créneaux). 1) Décris les colonnes. 2) Signale les lignes incohérentes (dates impossibles, totaux qui ne collent pas). 3) Propose 3 questions utiles à poser à un humain avant toute décision. N’invente pas de moyenne « officielle » absente des données. Données : [coller CSV]
Lis l’image jointe (facture ou affiche publique). Extrais en liste : fournisseur ou émetteur, date, montant TTC s’il est visible, numéro de pièce s’il est visible. Pour chaque champ : « lu dans l’image » ou « illisible / absent ». N’invente aucun montant. Si l’image est floue, dis-le.
Question factuelle locale ou régionale : [question]. Réponds uniquement avec des faits sourcés. Pour chaque fait, donne un lien ou un nom de page officielle. Si tu ne peux pas citer de source, réponds « je ne peux pas vérifier ». N’invente pas d’URL.
Écris un petit script [Python / bash] qui fait [tâche simple et non dangereuse]. Contraintes : code commenté en français, pas d’accès réseau, pas de suppression de fichiers hors d’un dossier temporaire explicite. Explique comment le lancer en une phrase. Signale les limites.
Traduis le texte suivant en [anglais / néerlandais], registre [soutenu / simple], pour [public]. Conserve les noms propres. Ne « localise » pas les institutions françaises en inventant des équivalents faux. Texte : [texte]
1) Traduis en français standard cette phrase en picard / ch’ti : « [phrase] ». 2) Propose une version ch’ti d’un message simple (invitation à un atelier), sans caricature insultante. Indique clairement ce qui est hypothétique. Si tu n’es pas fiable sur le picard, dis-le.
Épreuves 11 et 12 ne sont pas des prompts : ce sont des observations. Vitesse : temps ressenti pour une réponse utilisable sur le courriel et le résumé (rapide / correct / lent), sans chronomètre publié ici comme vérité scientifique. Confidentialité et cadre : présence d’un réglage d’activité / amélioration du modèle, clarté des conditions, et rappel — un texte collé quitte souvent votre poste. Voir les données et les hallucinations.
Tableau comparatif qualitatif (par familles)
Lignes = critères. Colonnes = familles. Cellules = mots, pas des notes. Lisez « souvent » comme tendance d’usage observée en septembre 2026, pas comme médaille.
| Critère | Chat généraliste cloud | Suite (ex. Copilot) | Réponses sourcées | Messagerie / social | Accès gratuit / alternatif |
|---|---|---|---|---|---|
| Courriel / brouillon FR | Souvent solide avec brief clair ; ton parfois générique | Pratique dans Word / Outlook si déjà équipé | Utile surtout si vous devez citer des pages | Correct pour un message court ; moins pour un dossier | Suffisant pour apprendre ; quotas et modèles varient |
| Long document public | Variable selon fenêtre de contexte et patience à découper | Confortable près des fichiers Office déjà là | Bon réflexe quand la vérité est hors modèle | Peu adapté aux PDF longs | Souvent plus limité sur la longueur ou le fichier |
| Faits locaux HdF | Risque d’invention fluide sans source | Même risque hors document fourni | Meilleure piste si liens vérifiables | Faible pour l’info institutionnelle fine | Même prudence : fluent ≠ vrai |
| Tableur / image | Multimodal selon produit ; invente parfois un montant | Fort près d’Excel / fichiers métier | Selon outil ; toujours vérifier | Limité | Fonctions souvent réduites |
| Cadre données | Cloud éditeur ; réglages d’activité à chercher | Cadre tenant / licence structure souvent décisif | Cloud + pages lues ; journaliser les sources | Lié au compte social ; prudence forte | Lire conditions ; « gratuit » ≠ « privé » |
| Pour qui, en tendance | Rédaction, plans, exploration | Équipes déjà Microsoft | Vérification et veille | Gestes légers dans le fil | Découverte sans abonnement |
Pour un comparatif plus court orienté choix quotidien, voyez aussi ChatGPT, Le Chat, Claude, Gemini, Copilot. Pour l’écart ouvert / fermé : propriétaire vs open source.
Scènes Hauts-de-France (ce qu’on a vraiment regardé)
À Lille, une chargée de communication d’association a collé le même brief d’invitation à un atelier (lieu, heure, public, trois faits) dans deux chats cloud. L’un a inventé un « partenariat métropolitain » absent du brief. L’autre a posé une question sur le nombre de places. Le second a gagné non pas une note, mais moins de corrections de fond.
À Lens, un secrétaire de structure a demandé un résumé d’une délibération publique. Les outils qui ont respecté « non précisé » quand le montant n’y était pas ont été jugés plus sûrs que ceux qui « complétaient » pour faire joli. À Beauvais, un artisan a testé un tableur de rendez-vous anonymisé : l’intérêt n’était pas la moyenne inventée, mais la détection d’une date incohérente.
À Dunkerque, la question « recherche avec sources » a séparé les outils qui citent des pages ouvertes de ceux qui affirment sans lien. À Amiens, le bonus ch’ti a surtout servi d’antidote à la confiance excessive : même un modèle brillant ailleurs peut caricaturer le picard. Détails dans le test ch’ti.
Ces scènes ne sont pas un panel statistique régional. Ce sont des situations de lecture critique, répétables. Elles valent plus, pour vous, qu’un podium viral.
Lire le test par usage (pas par marque)
Écrire un courriel ou une annonce : priorisez le brief (rôle, objectif, faits) et la relecture. Plusieurs familles s’en sortent. Le différenciateur est souvent le ton générique et l’invention de motifs.
Comprendre un document public : exigez le « non précisé » et les citations. Découpez si le fichier est long. Voir aussi quel français à l’aveugle pour le style, distinct de la fidélité factuelle.
Vérifier un fait local : ne faites pas confiance au modèle seul. Passez par une source officielle ou un outil qui montre des liens, puis ouvrez les pages. Le test HdF montre pourquoi.
Travailler dans une suite déjà payée par la structure : le « meilleur chat du monde » peut être le mauvais choix organisationnel. La charte interne prime. Une charte IA aide à cadrer.
Découvrir sans payer : le comparatif gratuit décrit limites et réglages, sans inventer de quotas chiffrés figés.
Ce que ce test ne prouve pas
Il ne prouve pas qu’une marque est « la meilleure IA 2026 ». Il ne prouve pas la sécurité juridique d’un collage. Il ne prouve pas la connaissance permanente d’une commune. Il ne prouve pas qu’un modèle restera stable après la prochaine mise à jour. Il ne prouve pas qu’un usage multimodal brillant sur une affiche claire le sera sur une facture floue.
Il ne prouve pas non plus qu’IAHDF aurait « mesuré la vérité » pour toute la région. Nous décrivons une méthode et des tendances. Votre métier, votre charte, votre boîte mail dominante peuvent inverser le choix.
Comment le lecteur refait le test
Choisissez deux outils autorisés chez vous. Prenez un vrai courriel de la semaine et un extrait de document public. Copiez les prompts 1 et 2 sans les modifier entre les onglets. Comptez les corrections de fond (faits, inventions, oublis), pas la longueur. Notez si vous trouvez un réglage d’activité / amélioration du modèle.
Ajoutez une question locale vérifiable (maire, date, lieu) en mode « je ne sais pas autorisé ». Comparez avec le protocole HdF. Si vous rédigez beaucoup, ajoutez un test à l’aveugle simple comme dans le français à l’aveugle.
Gardez le même couple d’outils pendant deux semaines avant d’en juger un troisième. Le grand test sert de boussole ; votre semaine sert de verdict.
Refaire en six gestes
Autorisation et données
Vérifiez ce que votre structure permet. Écartez tout texte nominatif. Travaillez sur du public ou de l’anonymisé.
Deux outils seulement
Pas six onglets le premier jour. Deux suffisent pour apprendre à lire les écarts.
Même consigne collée
Prompts 1 et 2 ci-dessus, faits réels entre crochets remplacés, aucune reformulation entre outils.
Grille de corrections
Trois colonnes : invention / oubli / ton. Une croix suffit. Pas besoin de moyenne sur 10.
Une question locale piège
Vérifiez la réponse sur une page officielle. Gardez la capture mentale : fluent ≠ vrai.
Décision d’usage
Gardez l’outil le moins corrigé sur vos tâches, compatible avec votre cadre. Revenez dans un mois.
Pour progresser en atelier, consultez l’agenda. Pour rejoindre la communauté IAHDF : l’inscription.
Confidentialité, gratuit, open source : liens utiles
Le grand test cloud ne remplace pas une réflexion données. Lisez les données, gratuités, modèles open source et l’écart qualité ouvert / fermé. Un modèle local change le lieu du traitement ; il ne dispense pas de la relecture ni des licences.
La vitesse perçue trompe : un outil très rapide qui invente un montant vous fait perdre plus de temps qu’un outil un peu plus lent qui dit « non précisé ». Mesurez le temps jusqu’à un texte envoyable, pas jusqu’au premier token.
Comment lire ce papier avec le reste du site
Parcours suggéré : ce grand test → comparatif court par usage → fiche de l’outil retenu (ChatGPT, Le Chat, Claude, Gemini, Copilot) → banc de test maison. Pour les hallucinations locales : HdF puis hallucinations.
Si vous formez une équipe, couplez la lecture à une charte et à un atelier listé sur l’agenda. La méthode se transmet mieux à plusieurs que seule face à un classement Twitter.
Questions fréquentes
Quelle est la meilleure IA en 2026 selon IAHDF ?
Nous ne désignons pas de gagnant absolu. La « meilleure » est celle que vous corrigez le moins sur vos tâches réelles, que votre structure autorise, et dont vous comprenez où part le texte. Ce grand test donne un protocole et des tendances par familles, pas un podium chiffré. Refaites les épreuves 1 et 2 sur un courriel et un document public de votre semaine, puis décidez. Les classements viraux changent trop vite pour remplacer ce geste. Pour un choix plus court, voyez aussi le comparatif par usage. IAHDF n’est rémunéré par aucun éditeur cité.
Pourquoi ne publiez-vous pas de notes sur 10 ?
Parce qu’une note unique mélange des gestes incomparables (courriel, quiz local, image, script) et donne une fausse précision. Une moyenne inventée rassure plus qu’elle n’informe. Nous préférons des mots dans un tableau qualitatif et une méthode reproductible. Si vous voulez des scores, construisez les vôtres avec 20 prompts et une grille : vos pondérations (style, fidélité, sources) seront plus honnêtes qu’un chiffre IAHDF sorti d’un chapeau. Nous pouvons décrire des tendances ; nous refusons le théâtre du classement. Cette réponse détaillée vise à vous donner assez de contexte pour décider sans score magique, en gardant la relecture humaine, la vérification des faits et le cadre de votre structure comme priorités non négociables.
Puis-je faire confiance à une IA pour une info sur ma commune ?
Non comme source unique. Les modèles inventent volontiers un maire, une date de fête ou un nom de quartier avec un ton assuré. Utilisez l’épreuve 3 et le dossier connaissance des Hauts-de-France, exigez « je ne sais pas », puis vérifiez sur une page officielle. Un outil avec liens aide seulement si vous ouvrez réellement les pages. Pour le mécanisme des inventions fluides, lisez les hallucinations. La confiance se place dans votre vérification, pas dans la phrase générée. Cette réponse détaillée vise à vous donner assez de contexte pour décider sans score magique, en gardant la relecture humaine, la vérification des faits et le cadre de votre structure comme priorités non négociables.
Faut-il payer un abonnement pour juger correctement ?
Non pour démarrer. Comparez d’abord en gratuit sur un vrai texte, avec le même brief dans deux outils. Payez seulement si un frein concret revient souvent (longueur, débit, fonction fichier) et si votre usage le justifie. Les offres bougent : nous ne figeons pas de tarifs ici. Voir IA gratuites et les retours de membres sur le fait de payer. Un abonnement n’achète ni la relecture ni une charte données. Il achète éventuellement du confort — après diagnostic, pas avant. Cette réponse détaillée vise à vous donner assez de contexte pour décider sans score magique, en gardant la relecture humaine, la vérification des faits et le cadre de votre structure comme priorités non négociables.
Comment participer ou refaire le test avec d’autres ?
Reprenez les prompts publiés, formez un binôme, chronométrez le temps jusqu’au texte envoyable, et partagez vos grilles de corrections sans données personnelles. Les ateliers et temps d’échange apparaissent sur l’agenda. Pour suivre la communauté IAHDF et les prochains protocoles : l’inscription. Apportez vos documents publics régionaux plutôt que des sujets inventés : le test gagne en vérité. Aucune capture nominative dans un canal public. La lecture critique se cultive à plusieurs mieux qu’en collectionnant les logos. Cette réponse détaillée vise à vous donner assez de contexte pour décider sans score magique, en gardant la relecture humaine, la vérification des faits et le cadre de votre structure comme priorités non négociables.
