L'IA générative on-premise en entreprise : ce qu'il faut savoir avant de décider.
On-premise, souverain, privé : trois mots employés comme des synonymes, alors qu'ils désignent trois choses différentes. Ce guide démêle les définitions, décrit l'architecture réelle d'une plateforme d'IA générative interne, détaille ce qu'elle coûte vraiment, et donne une grille pour arbitrer.
On-premise, souverain, privé : trois notions distinctes
La confusion entre ces termes est la première cause de mauvaise décision. Un fournisseur peut être parfaitement sincère en disant « souverain » tout en désignant autre chose que ce que vous avez compris. Trois questions différentes se cachent derrière ces mots : où tournent les traitements, qui a un pouvoir juridique sur les données, et qui peut techniquement y accéder.
Où s'exécutent les traitements ?
Se vérifieEn observant les flux réseau sortants.Quel droit s'applique à l'opérateur ?
Se vérifiePar la loi dont relève l'entité qui opère.Qui peut techniquement accéder aux données ?
Se vérifiePar les canaux de télémétrie et de support.On-premise : une question de lieu d'exécution
On-premise signifie que le logiciel s'exécute sur une infrastructure que vous contrôlez : vos serveurs, votre datacenter, ou un cloud privé dont vous maîtrisez le périmètre. C'est une propriété d'architecture, pas une promesse contractuelle. Elle se vérifie : vous pouvez regarder les flux réseau sortants.
Souverain : une question de droit applicable
La souveraineté n'est pas la localisation. Une donnée hébergée en France, mais opérée par une entité soumise à une loi extraterritoriale, reste exposée à cette loi. La bonne question n'est pas « où sont mes données » mais « quel droit s'applique à l'entité qui les opère, et qui peut être contraint de les remettre ». C'est ce qui distingue un hébergement européen d'une réelle immunité juridique.
Privé : une question d'accès effectif
Une plateforme privée est une plateforme à laquelle personne d'autre que vous n'accède, y compris l'éditeur. Beaucoup de solutions dites privées conservent un canal de télémétrie, de support ou d'amélioration du modèle. Ce n'est pas illégitime, mais cela doit être explicite, et vous devez pouvoir le couper.
Posez une seule question à votre fournisseur : « si je coupe tout accès Internet sortant de la plateforme, qu'est-ce qui cesse de fonctionner ? » La réponse décrit exactement ce qui sort de votre système d'information. Une plateforme réellement on-premise continue de fonctionner, en dehors des modèles externes que vous avez choisi de brancher.
Pourquoi des entreprises choisissent l'on-premise
Le réflexe est d'y voir une position défensive, motivée par la peur. Dans les faits, les organisations qui font ce choix avancent quatre raisons, et une seule relève de la conformité.
- La nature des données. Dossiers patients, pièces de procédure, données de défense, tarification d'assurance, code source : dans certains métiers, l'envoi vers un tiers ne se négocie pas, quel que soit le contrat signé.
- L'exposition juridique. Le RGPD, le secret professionnel et les obligations sectorielles créent une responsabilité qui reste la vôtre, même quand le traitement est délégué. L'architecture est le seul moyen de réduire l'exposition plutôt que de la transférer sur le papier.
- La maîtrise des coûts. Une facturation à l'usage sur un volume qui croît est difficile à prévoir. Une infrastructure interne transforme une dépense variable en dépense capacitaire, que l'on dimensionne et que l'on plafonne.
- L'indépendance vis-à-vis d'un fournisseur. Les modèles changent vite, leurs prix et leurs conditions aussi. Une plateforme qui vous permet de changer de modèle sans redéployer vos cas d'usage vous évite d'adosser votre stratégie à un catalogue que vous ne contrôlez pas.
Ces quatre motifs n'ont pas le même poids selon les organisations. Une DSI qui n'a que le troisième a probablement intérêt à un modèle hybride plutôt qu'à un déploiement complet.
L'architecture réelle d'une plateforme interne
Un déploiement d'IA générative en entreprise ne se réduit pas à héberger un modèle. Le modèle est la brique la plus visible, rarement la plus coûteuse à exploiter. Une plateforme complète comporte cinq couches.
- Le service d'inférence. Le moteur qui exécute les modèles, typiquement vLLM ou Ollama pour des modèles locaux. C'est lui qui consomme le GPU, et c'est son dimensionnement qui détermine le nombre d'utilisateurs simultanés supportables.
- La couche documentaire, ou RAG. L'ingestion, le découpage et l'indexation de vos documents, puis la recherche qui alimente le modèle. C'est ce qui fait la différence entre un assistant générique et un assistant qui connaît votre organisation. C'est aussi la couche qui demande le plus de travail d'exploitation dans la durée.
- L'identité et les droits. Le raccordement à votre annuaire (LDAP, OIDC, SAML) et un contrôle d'accès qui s'applique aussi aux documents indexés. Une base documentaire qui ignore vos droits transforme un moteur de recherche interne en fuite d'information généralisée.
- La gouvernance. Qui a droit à quel modèle, avec quel plafond de dépense, sur quels connecteurs, avec quelle validation humaine sur les actions sensibles. Sans cette couche, une plateforme reste un prototype toléré, pas un service d'entreprise.
- L'observabilité et l'audit. La trace de ce qui a été demandé, par qui, avec quel modèle, sur quelles sources, et pour quel coût. C'est ce qui rend le service défendable devant un auditeur, et pilotable par la DSI.
Les projets qui échouent sous-estiment presque toujours les trois dernières couches. Elles n'ont rien de spectaculaire en démonstration, et ce sont elles qui décident du passage à l'échelle.
Ce que ça coûte vraiment
Comparer un abonnement par utilisateur au prix d'un serveur GPU n'a pas de sens : les deux ne recouvrent pas les mêmes postes. Un coût complet de plateforme interne se décompose en quatre lignes.
Dimensionnée sur les utilisateurs simultanés, pas sur l'effectif.
CapacitaireÀ vérifier : l'éditeur prend-il une marge sur l'inférence ?
FixeMises à jour, supervision, sources documentaires, support.
RécurrentUniquement si des modèles SaaS sont branchés en hybride.
Variable- L'infrastructure de calcul. Le poste le plus visible. Il dépend du modèle retenu et surtout du nombre d'utilisateurs simultanés, pas du nombre d'utilisateurs déclarés. Un usage réel est très concentré sur quelques heures de la journée.
- La licence logicielle. La plateforme elle-même. Vérifiez surtout si l'éditeur prend une marge sur l'inférence : dans ce cas, votre facture croît avec votre usage, ce qui reproduit exactement le modèle que vous cherchiez à quitter.
- L'exploitation. Les mises à jour, la supervision, l'ajout de sources documentaires, le support aux métiers. C'est un coût récurrent d'équipe, souvent absent des comparatifs, et rarement nul.
- L'inférence externe éventuelle. Si vous branchez aussi des modèles SaaS pour certains usages, cette consommation reste à votre charge. Contractualiser en direct avec le fournisseur vous garantit d'en connaître le prix réel.
L'arbitrage économique se joue sur le volume et la durée. En dessous d'un certain usage, le SaaS reste moins cher. Au-delà, et surtout sur plusieurs années, la dépense capacitaire devient plus prévisible et souvent plus basse. Le point de bascule dépend trop de votre situation pour qu'un chiffre générique ait la moindre valeur.
Les pièges les plus fréquents
Ces quatre erreurs reviennent projet après projet, et aucune n'est de nature technique.
Croire que local vaut conforme
Héberger un modèle chez vous ne vous met pas en conformité. Le RGPD porte sur la finalité, la minimisation, la durée de conservation et les droits des personnes. Une plateforme interne mal gouvernée qui indexe sans contrôle des données personnelles est un problème de conformité, pas une solution.
Dimensionner sur le nombre d'utilisateurs déclarés
Le dimensionnement se fait sur la simultanéité et sur la longueur des contextes traités, pas sur l'effectif. Un projet dimensionné sur le nombre de comptes est soit surdimensionné et cher, soit inutilisable aux heures de pointe.
Négliger la qualité documentaire
Un RAG branché sur une base documentaire obsolète produit des réponses fausses avec l'assurance d'une réponse sourcée. C'est plus dangereux qu'une absence de réponse, parce que l'erreur est crédible. Le travail sur les sources précède le déploiement, il ne le suit pas.
Se lier à un modèle unique
Construire des cas d'usage sur les particularités d'un modèle donné crée une dépendance forte au moment où le paysage bouge le plus vite. Une plateforme agnostique, où le modèle est une ressource interchangeable, protège l'investissement fait sur les cas d'usage.
On-premise, SaaS ou hybride : comment arbitrer
Le choix n'est pas binaire, et la bonne réponse est souvent un mélange : traitements sensibles en interne, usages banals sur un modèle externe. Cette grille compare les trois options sur les critères qui décident réellement.
| Critère | On-premise | SaaS | Hybride |
|---|---|---|---|
| Sortie des données | Aucune, par architecture | Systématique, encadrée par contrat | Choisie cas par cas, anonymisation avant envoi |
| Délai de mise en service | Le plus long, dépend de votre infrastructure | Immédiat | Intermédiaire |
| Structure de coût | Capacitaire, prévisible | Variable, croît avec l'usage | Mixte, à plafonner |
| Charge d'exploitation | À votre charge | Chez le fournisseur | Partagée |
| Accès aux meilleurs modèles | Limité aux modèles ouverts | Immédiat | Immédiat, sur les usages autorisés |
En pratique, la question utile n'est pas « quelle option choisir » mais « quels traitements ne doivent jamais sortir ». Une fois cette liste établie, l'architecture en découle presque mécaniquement.
Où se situe SmartAGT
SmartAGT est une plateforme d'agents IA gouvernés qui se déploie on-premise dans votre système d'information. Mémoire, bases documentaires, historique et identités restent chez vous. En mode hybride, les données personnelles sont anonymisées avant tout appel à un modèle externe.
La plateforme est agnostique en modèles, ne prend aucune marge sur votre inférence, et intègre les couches d'identité, de gouvernance et d'audit décrites plus haut. Ce guide reste valable quel que soit l'outil que vous retiendrez : il décrit des critères, pas un produit.
Questions fréquentes
Une IA générative on-premise est-elle conforme au RGPD par défaut ?
Non. L'hébergement interne réduit fortement l'exposition, mais la conformité porte sur la finalité du traitement, la minimisation des données, les durées de conservation et les droits des personnes. Une plateforme interne qui indexerait sans contrôle des données personnelles poserait un problème de conformité, malgré son hébergement.
Quelle puissance de calcul faut-il pour démarrer ?
Le dimensionnement dépend du nombre d'utilisateurs simultanés et de la longueur des contextes traités, pas de l'effectif déclaré. Un pilote sur un périmètre métier restreint permet de mesurer l'usage réel avant d'engager une infrastructure de production, ce qui évite autant le surdimensionnement que la saturation aux heures de pointe.
Peut-on utiliser des modèles comme GPT ou Gemini tout en restant on-premise ?
Oui, en mode hybride. La plateforme reste déployée chez vous, et vous décidez modèle par modèle et usage par usage de ce qui peut être envoyé à un fournisseur externe. Une couche d'anonymisation avant envoi permet de bénéficier de ces modèles sur des contenus dont les données personnelles ont été retirées.
Quelle différence avec un assistant comme ChatGPT Enterprise ou Copilot ?
Ce sont d'excellents assistants individuels, mais conçus pour l'usage personnel : pas de contexte d'entreprise partagé, pas de gouvernance centrale des droits et des dépenses, et les données transitent par le fournisseur. Une plateforme d'agents vise l'inverse : des agents connectés à vos données, avec contrôle d'accès, observabilité et audit à l'échelle de l'organisation.