Vous n’avez pas de carte graphique adaptée chez vous, mais vous voulez héberger un modèle d’IA pour une équipe, un atelier ou une expérimentation sérieuse. Louer une instance GPU chez un hébergeur français (OVHcloud, Scaleway et d’autres) permet de garder une proximité juridique et géographique tout en accédant à de la puissance mutualisée. Ce tutoriel vous guide sans inventer de tarifs : vous apprendrez à lire les grilles du jour, à choisir selon la VRAM et le réseau, à déployer une stack locale type Ollama / Open WebUI ou vLLM, puis à verrouiller l’accès. L’angle Hauts-de-France : la proximité des data centers régionaux et la latence perçue depuis Lille, Amiens ou Valenciennes comptent autant que le catalogue marketing.
Pour qui, et pourquoi un GPU loué
Ce parcours s’adresse à des profils déjà à l’aise avec Linux en ligne de commande : responsables informatiques de PME, médiateurs numériques, artisans qui animent un FabLab, équipes associatives qui veulent un chat interne sans coller des dossiers dans un SaaS américain. Imaginez une agence à Roubaix qui prépare des synthèses pour des clients, une communauté de communes près de Douai qui expérimente un assistant sur documents publics, ou un atelier à Boulogne-sur-Mer qui mutualise une machine pour plusieurs bénévoles.
La question « Pas de GPU chez moi : où héberger ? » n’a pas une seule réponse magique. Un cloud français n’est pas automatiquement « souverain » au sens le plus strict, mais il simplifie souvent le dialogue juridique et la latence. Ce tutoriel compare des critères, pas des coupons publicitaires. Les noms OVHcloud et Scaleway sont des exemples courants du marché français : vérifiez toujours les fiches produit du jour, les zones disponibles et les conditions générales.
Offres GPU chez les hébergeurs français : lire avant de cliquer
Les catalogues évoluent : familles de cartes, quantités de VRAM, CPU, RAM système, stockage local ou réseau, facturation à l’heure ou au mois. Ne mémorisez pas un prix vu dans un article ancien. Ouvrez la page tarifaire officielle de l’hébergeur, notez la date, la zone (région / data center), le type d’instance et ce qui est inclus (trafic sortant, IP, snapshots). Si une offre « IA » regroupe plusieurs services, séparez le coût du GPU de celui du stockage et du réseau.
Depuis les Hauts-de-France, la proximité des data centers régionaux peut améliorer la sensation de réactivité pour un chat interactif et faciliter une visite technique ou un contrat avec un intégrateur local. Cela ne remplace pas une mesure : faites un test de latence et un essai d’upload depuis votre connexion fibre ou entreprise à Lille, Arras ou Calais. Une instance « proche » mais saturée reste moins agréable qu’une instance un peu plus loin mais stable.
IAHDF ne revendique aucun partenariat commercial avec les hébergeurs mentionnés. Nous citons des acteurs français parce que la question de la localisation des données revient souvent dans nos ateliers. Votre choix final dépend de votre budget réel, de votre politique d’achat et de votre DSI ou prestataire.
Choisir : critères objectifs, pas de montants fictifs
Avant de signer, écrivez une fiche d’une page : quel modèle visez-vous (ordre de grandeur de paramètres), usage chat interactif ou batch nocturne, nombre d’utilisateurs simultanés, données autorisées sur la machine, durée d’expérimentation (une semaine, un trimestre). Cette fiche évite d’acheter « le plus gros GPU » par peur de manquer.
| Critère | Pourquoi ça compte | Question à poser |
|---|---|---|
| VRAM disponible | Détermine la taille de modèle et la quantification réalistes | Le modèle cible tient-il avec marge pour le contexte ? |
| CPU / RAM système | Préparation des prompts, orchestration, OS | Assez de tête pour Docker, reverse-proxy et logs ? |
| Disque et I/O | Poids des modèles et des index | Où sont stockés les poids ? Snapshots inclus ? |
| Réseau et IP | Accès distant, bande passante, coût de sortie | Trafic sortant facturé comment sur la grille du jour ? |
| Localisation / zone | Latence, cadre juridique, prestataires | Data center acceptable pour votre politique données ? |
| Mode de facturation | Heure vs mois change le coût d’un labo intermittent | Puis-je éteindre sans perdre le disque ? |
Remplissez la dernière colonne avec des faits lus sur le site de l’hébergeur, pas avec des souvenirs de forum. Pour estimer les coûts mensuels, multipliez les unités facturables (heures machine, Go de disque, éventuel trafic) par les tarifs publiés le jour du devis. Si l’offre est promotionnelle, notez la date de fin. IAHDF ne publie ici aucun prix OVHcloud, Scaleway ou concurrent : les grilles bougent trop vite pour qu’un tutoriel figé reste honnête.
Déployer Ollama et Open WebUI sur l’instance
Pour beaucoup d’équipes HdF, le duo Ollama + Open WebUI reste le chemin le plus pédagogique : chat web, comptes, et modèles tirés proprement. Sur une instance Linux GPU, installez les pilotes selon la documentation de l’éditeur de la carte et de l’hébergeur, vérifiez que `nvidia-smi` (ou l’équivalent du jour) voit le GPU, puis installez Ollama et Docker. Tirez un petit modèle de test avant le gros téléchargement.
Exposez Open WebUI uniquement derrière un reverse-proxy avec TLS et authentification forte. Ne laissez pas le port d’administration ouvert sur Internet « le temps de tester ». Depuis un poste à Valenciennes, connectez-vous en VPN ou via un bastion si votre politique l’exige. Documentez les versions d’image Docker épinglées : une mise à jour surprise un vendredi soir n’est pas un plan de reprise.
# Estimation coûts instance GPU — ne pas inventer de tarifs # Remplir uniquement avec des chiffres lus sur le site de l’hébergeur le jour J. Hébergeur / offre / zone : Date de consultation de la grille : VRAM / type GPU (libellé catalogue) : Facturation : ☐ à l’heure ☐ au mois ☐ autre Heures prévues ce mois (labo) : Prix unitaire machine (grille du jour) : Stockage (Go) × tarif disque : Trafic sortant estimé × tarif sortie (si applicable) : IP / snapshots / sauvegardes : Sous-total mensuel estimé : Marge de sécurité (+20 % recommandée) : Décision : ☐ go ☐ réduire les heures ☐ changer d’offre Rappel : aucun montant ne doit provenir d’un tutoriel ou d’un souvenir.
Quand passer à vLLM (ou équivalent serving)
Ollama convient très bien à l’exploration et à une petite équipe. Lorsque vous devez servir un modèle avec plus de concurrence, des métriques d’API stables ou une intégration applicative, un serveur type vLLM (ou autre runtime compatible) devient intéressant. Le déploiement est plus exigeant : images CUDA, versions alignées, configuration du batching, monitoring. Ce n’est pas obligatoire pour un premier mois d’atelier.
Dans une PME de la métropole lilloise qui expose une API interne à trois applications, vLLM peut clarifier le contrat « endpoint + modèle ». Dans un FabLab qui change de modèle chaque semaine pour la pédagogie, Ollama reste souvent plus simple. Choisissez selon la dette d’exploitation que vous acceptez, pas selon la mode LinkedIn.
Estimer les coûts mensuels sans s’illusionner
Le coût machine n’est qu’une partie. Ajoutez le temps humain (installation, mises à jour, garde le week-end), le stockage des poids, les sauvegardes, et le risque d’oubli : une instance allumée 24 h/24 pour trois utilisateurs dilue le budget. Pour un labo intermittent, préférez une facturation à l’heure si elle existe sur l’offre retenue, et automatisez l’arrêt hors plages d’atelier.
Présentez à votre direction une fourchette basée sur la grille du jour plus une marge, pas un « prix moyen Internet ». Si vous comparez deux hébergeurs français, alignez les unités (même VRAM approximative, même zone de confiance, même hypothèse d’heures). Un tableau de critères comme ci-dessus vaut mieux qu’un classement subjectif.
Sécurité : le serveur GPU n’est pas un jouet
Une instance GPU exposée est une cible de choix : puissance de calcul, parfois disque rempli de modèles, parfois données métier collées pour « tester le RAG ». Appliquez le minimum vital : comptes SSH par clé, pas de mot de passe root ouvert, pare-feu restrictif, mises à jour, utilisateurs Open WebUI avec rôles, journaux d’accès. Séparez l’environnement de démonstration (données fictives) de l’environnement qui touche des dossiers réels.
Souveraineté : ce que l’on peut dire sans marketing
« Souverain » est un mot chargé. Un data center en France, un contrat en français, un support joignable dans votre fuseau : ce sont des arguments concrets pour beaucoup de structures HdF. Cela ne signifie pas automatiquement conformité maximale à tous les référentiels, ni absence de dépendances (images Docker, modèles hébergés ailleurs, CDN). Documentez la chaîne : où tournent les poids, où sont les logs, où partent les sauvegardes.
Pour une collectivité ou une association qui doit expliquer le choix à un comité, préparez une slide : localisation, critères du tableau, extrait de la grille tarifaire du jour (lien + date), mesures de sécurité, durée de l’expérimentation, critère d’arrêt. La transparence bat le discours « on a pris le cloud IA du moment ».
Pas à pas : de la grille tarifaire au chat utilisable
Rédiger la fiche de besoin (une page)
Listez l’usage (chat interne, démo atelier, API batch), le modèle cible en ordre de grandeur, le nombre d’utilisateurs, la durée d’essai, et le type de données autorisées. Faites valider cette fiche par une personne métier et une personne technique. Sans ce cadrage, vous risquez de surdimensionner l’instance ou d’y coller des fichiers inappropriés. Conservez la fiche dans le même dossier que le futur devis : elle justifiera les heures facturées devant un financeur ou un bureau associatif à Amiens comme à Tourcoing.
Comparer deux offres françaises sur critères, pas sur souvenirs
Ouvrez les pages officielles d’au moins deux hébergeurs français proposant du GPU. Remplissez le tableau de critères (VRAM, disque, réseau, zone, mode de facturation). Copiez les libellés exacts des instances et la date de consultation. N’inscrivez aucun montant qui ne figure pas sur la grille du jour. Si une zone proche des Hauts-de-France existe, notez-la comme option, puis vérifiez la disponibilité réelle au moment de la commande : les stocks GPU varient. Conservez les captures datées dans le dossier devis pour un financeur ou un bureau associatif.
Estimer le budget avec la grille du jour
Utilisez la checklist nowdoc de ce tutoriel. Multipliez heures prévues × tarif machine, ajoutez stockage et options lues sur la grille officielle. Appliquez une marge de sécurité d’environ vingt pour cent. Présentez le total comme une estimation à date, pas comme un engagement IAHDF. Si le budget dépasse, réduisez les heures (arrêt automatique), choisissez une VRAM plus basse avec un modèle plus petit, ou reportez le gros modèle à une phase 2. Mieux vaut un labo sobre qui tourne qu’une facture surprise en fin de mois.
Créer l’instance et sécuriser l’accès SSH
Provisionnez l’instance dans la zone retenue. Ajoutez votre clé SSH, désactivez l’auth par mot de passe si la procédure le permet, configurez le pare-feu pour n’ouvrir que le nécessaire. Vérifiez immédiatement que le GPU est visible avec l’outil de diagnostic fourni par la stack (souvent `nvidia-smi`). Créez un utilisateur non root pour le quotidien. Documentez l’IP, le nom d’instance et le contact hébergeur dans un gestionnaire de secrets d’équipe, jamais dans un pad public d’atelier ni un fil Discord ouvert.
Installer la stack IA (Ollama + Open WebUI ou vLLM)
Installez les pilotes selon la doc hébergeur / éditeur, puis Ollama et Docker. Tirez d’abord un petit modèle pour valider l’inférence GPU avant le gros téléchargement. Déployez Open WebUI avec volume persistant, ou configurez vLLM si votre fiche de besoin l’exige. Placez un reverse-proxy TLS devant l’interface. Créez le compte admin, un compte test, et refusez les comptes anonymes ouverts sur Internet. Testez depuis un poste à Lille et depuis un autre site (par exemple Arras) pour sentir la latence réelle de bout en bout.
Closoir exploitation : arrêt, sauvegarde, revue à 30 jours
Automatisez l’arrêt hors plages d’usage si la facturation à l’heure le justifie. Définissez ce qui est sauvegardé (configuration, pas forcément tous les poids de modèles). Planifiez une revue à trente jours : heures réellement consommées versus estimation, incidents de sécurité, utilité métier perçue par l’équipe. Décidez explicitement de prolonger, de réduire, ou de migrer. Pour approfondir la posture matériel avant de louer, enchaînez avec installer Ollama et, selon votre catalogue, vLLM en production / sauvegarder Open WebUI sur les sujets voisins d’hébergement et d’exploitation.
Animer le sujet en atelier régional
Dans un atelier IAHDF, projetez la page tarifaire officielle en direct plutôt qu’une capture figée. Demandez aux participants de remplir le tableau de critères en binômes, chacun avec un hébergeur différent. Le moment « on refuse d’écrire un prix de mémoire » est pédagogique : il ancre l’honnêteté budgétaire. Terminez par une démo de déploiement sur une instance de labo jetable, données fictives uniquement.
Les FabLabs et Maisons de l’emploi numériques de la région peuvent mutualiser une instance pour plusieurs sessions : dans ce cas, la gouvernance des comptes et le calendrier d’arrêt deviennent le vrai sujet, plus que le choix de la marque cloud.
Limites honnêtes
Ce tutoriel ne remplace pas un devis signé, ni un audit de sécurité, ni un avis juridique sur la sous-traitance. Les catalogues GPU changent. Une instance « disponible » ce matin peut être en rupture ce soir. Les performances dépendent du modèle, de la quantification et de la charge : mesurez chez vous. IAHDF n’est pas un revendeur et ne garantit aucun temps de réponse d’un hébergeur tiers.
Questions fréquentes
Pas de GPU chez moi : où héberger mon IA ?
Chez un fournisseur d’instances GPU, idéalement en choisissant une zone et un contrat compatibles avec votre politique de données. En France, des acteurs comme OVHcloud ou Scaleway proposent des catalogues GPU : lisez leurs fiches et grilles du jour. Vous pouvez aussi mutualiser via un prestataire ou un FabLab équipé. Le bon choix dépend de la VRAM nécessaire, du budget d’heures et du niveau de sécurité exigé, pas d’un classement improvisé.
Quel est le prix mensuel typique ?
Il n’existe pas de « prix typique » stable assez longtemps pour qu’un tutoriel le grave dans le marbre. Consultez la grille tarifaire officielle de l’hébergeur le jour J, multipliez par vos heures et options, ajoutez une marge. Méfiez-vous des articles qui citent des montants sans date. Votre estimation doit pouvoir être retracée (lien + capture datée) pour un financeur.
Ollama / Open WebUI ou vLLM ?
Pour découvrir et servir une petite équipe via une interface chat, Ollama + Open WebUI est souvent le plus rapide à prendre en main. Pour une API plus « production », avec concurrence et intégrations, évaluez vLLM ou un runtime équivalent. Beaucoup d’organisations commencent par Ollama puis migrent une partie du trafic. Le critère est la charge d’exploitation acceptée, pas la prestigie du logo.
Un cloud français suffit-il pour la souveraineté ?
C’est un élément favorable (localisation, langue du contrat, latence), pas une garantie absolue. Vérifiez où vivent les sauvegardes, qui accède à la console, quelles images et quels modèles vous tirez, et ce que disent les CGU. Documentez la chaîne pour votre comité. La souveraineté se construit par des choix tracés, pas par un seul drapeau sur une fiche marketing.
Que faire après ce tutoriel ?
Validez une offre sur critères, déployez une instance de labo avec données fictives, mesurez usage réel pendant un mois, puis décidez. Pour le matériel local alternatif, voyez installer Ollama. Pour l’API concurrente, servir avec vLLM. Pour la maintenance, sauvegarder Open WebUI. Pour pratiquer en présentiel, consultez l’agenda et l’inscription ci-dessous.
