Sommaire
Choisir son architecture

Le coût réel d'une IA générative en entreprise : construire son TCO

Le prix d'une IA générative se présente presque toujours sous la forme d'un chiffre unique : un abonnement par utilisateur, un prix au million de jetons, un devis de serveur. Aucun ne dit ce que la plateforme coûtera réellement sur sa durée de vie. Ce guide donne les postes à chiffrer, les pièges des grilles tarifaires et une méthode pour construire un coût complet avant de signer.

Publié le 22 septembre 2026

Pourquoi le prix affiché ne dit presque rien

Comparer des offres d'IA générative sur leur prix affiché revient à comparer des voitures sur le prix du plein. Un abonnement par utilisateur ne dit rien de l'intégration à votre système d'information. Un prix au jeton ne dit rien du nombre de jetons qu'un usage réel consomme. Un devis de serveur ne dit rien de l'équipe qui devra l'exploiter.

Le coût complet, ou TCO (total cost of ownership), additionne tout ce que la plateforme coûtera entre la décision d'achat et son remplacement : les dépenses fixes, les dépenses variables et les dépenses internes, souvent invisibles parce qu'elles sont payées en temps d'équipe.

Pour un déploiement interne, le guide L'IA générative on-premise en entreprise présente les quatre postes d'une plateforme hébergée chez vous. Ce guide élargit le périmètre à tous les modèles de déploiement, et s'attache à la méthode de chiffrage.

Les postes d'un coût complet

Un TCO sérieux couvre huit postes. Les trois derniers manquent dans la plupart des comparatifs, alors qu'ils pèsent souvent autant que les premiers.

PosteNatureCe qui le fait varier
Licence ou abonnementFixeNombre d'utilisateurs, modules, durée d'engagement
InférenceVariable (API) ou capacitaire (GPU)Volume réel, taille des contextes, modèle choisi
Infrastructure annexeCapacitaireStockage des documents indexés, base vectorielle, sauvegardes
IntégrationPonctuelAnnuaire, connecteurs vers les outils métier, réseau
ExploitationRécurrentMises à jour, supervision, support aux utilisateurs
Qualité documentaireRécurrentTri, mise à jour et gouvernance des sources indexées
ConformitéPonctuel puis récurrentAnalyse d'impact, revues juridiques, audits
AccompagnementPonctuel puis récurrentFormation, référents métier, animation des usages

Deux postes méritent une attention particulière. La qualité documentaire, parce qu'un assistant branché sur des documents obsolètes coûte en erreurs ce qu'il économise en recherche. La conformité, parce qu'une analyse d'impact faite après le déploiement coûte plus cher qu'avant, et peut imposer de revoir l'architecture.

Ce qui fait grimper la facture d'inférence

L'inférence est le poste le plus difficile à prévoir, parce qu'il dépend de mécanismes que l'utilisateur ne voit pas. Quatre facteurs expliquent la plupart des écarts entre l'estimation et la facture.

La longueur du contexte

Dans une conversation, l'historique est renvoyé au modèle à chaque tour. La dixième question coûte en général nettement plus cher que la première.

Les extraits documentaires

Un assistant documentaire ajoute des passages de vos documents à chaque question. Ce sont souvent eux, et non la question, qui pèsent le plus.

Les agents

Une tâche confiée à un agent déclenche plusieurs appels : planifier, appeler un outil, relire le résultat, répondre. Une seule question peut en déclencher de nombreux.

Le modèle par défaut

Utiliser le modèle le plus puissant pour tout, y compris pour classer un courriel, multiplie la facture sans gain de qualité.

Quatre mécanismes invisibles pour l'utilisateur, qui expliquent l'essentiel des dérives.

Deux détails de facturation s'ajoutent. Les jetons d'entrée et les jetons de sortie sont souvent facturés à des tarifs différents : un usage qui rédige beaucoup ne coûte pas comme un usage qui lit beaucoup. Et une partie des fournisseurs facture en dollars : votre coût en euros suit alors le taux de change, ce qu'un budget annuel doit anticiper.

Lire un modèle tarifaire

À usage égal, deux offres au prix affiché comparable peuvent diverger fortement dans la durée. Tout dépend de la manière dont le prix réagit à la croissance de l'usage.

Modèle tarifairePrévisibilitéCe qu'il faut vérifier
Par utilisateur, inférence incluseForte pour l'acheteurLimites d'usage cachées, bridage ou modèle dégradé au-delà d'un seuil
Par utilisateur, inférence refacturéeFaibleMarge appliquée sur l'inférence, tarif réel du fournisseur de modèle
Crédits prépayésFaibleConversion entre crédits et jetons, possibilité de la modifier en cours de contrat
Licence et inférence contractée en directMoyenne, pilotablePlafonds de dépense disponibles, suivi du coût par usage
Capacité GPU interneForte, par paliersTaux d'utilisation réel, coût du palier suivant

La question décisive à poser à un éditeur tient en une phrase : « si notre usage double, que devient notre facture, et qui en profite ? » Si l'éditeur prend une marge sur l'inférence, votre succès finance sa croissance. Les crédits posent un autre problème : ils masquent le prix unitaire réel et rendent toute comparaison impossible.

Construire un TCO défendable

Un TCO sert à décider, pas à rassurer. Il doit donc reposer sur des mesures et présenter une fourchette, pas un chiffre unique.

  1. Délimiter les usagesQuels usages, pour quelles populations, sur quelles données. Chaque usage a son profil de consommation.
  2. Mesurer sur un piloteVolume de requêtes, longueur moyenne des échanges, heures de pointe, part des agents. Une semaine de mesure vaut mieux qu'un mois d'hypothèses.
  3. Projeter l'adoptionL'usage monte par paliers, pas d'un coup. Modélisez une montée progressive, avec un scénario bas et un scénario haut.
  4. Chiffrer tous les postesLes huit postes du tableau, sur la durée de vie prévue de la plateforme, en séparant fixe, variable et temps interne.
  5. Chiffrer la sortieLe coût de reprise des données, de l'historique et des cas d'usage si vous changez de solution. C'est le poste que personne n'écrit.
Cinq étapes pour passer d'un prix affiché à un coût complet.

Le point de bascule entre SaaS et hébergement interne sort naturellement de cet exercice. Il dépend de votre volume, de votre horizon et de la sensibilité de vos données : aucun chiffre générique ne le remplace. Le choix de l'architecture, usage par usage, est traité dans le guide On-premise, SaaS ou hybride.

Les erreurs à éviter

Chiffrer sur la démonstration

Une démonstration utilise des questions courtes, sans historique ni documents. L'usage réel est plus long, plus documenté et plus agentique. Un budget calé sur une démonstration est un budget faux.

Comparer des unités différentes

Un prix par utilisateur, un prix au jeton et un prix de serveur ne se comparent pas directement. Ramenez tout à un coût par usage mesuré, sur la même période.

Oublier que la dépense variable se pilote

Un TCO suppose que la consommation reste dans la fourchette prévue. Sans plafonds ni alertes, rien ne l'y maintient. Le pilotage au quotidien fait l'objet du guide Quotas IA.

Choisir le modèle avant d'avoir mesuré

Le choix du modèle change le coût d'un facteur important. Un petit modèle peut suffire pour une large part des tâches courantes. Le guide LLM open source ou propriétaire détaille comment l'évaluer sur vos propres cas.

Questions fréquentes

Combien coûte une IA générative pour une entreprise de 500 personnes ?

Aucune réponse honnête ne tient en un chiffre : le coût dépend des usages retenus, de la part d'agents, des modèles choisis et du mode de déploiement. Un pilote de quelques semaines, sur un périmètre métier réel, donne les mesures nécessaires pour construire une fourchette fiable.

Le on-premise est-il toujours moins cher sur la durée ?

Non. Il transforme une dépense variable en dépense capacitaire, ce qui devient avantageux avec un usage important et stable. Avec un usage faible ou très irrégulier, une infrastructure dimensionnée pour les heures de pointe reste sous-utilisée, et le SaaS coûte moins cher.

Faut-il budgéter l'inférence par utilisateur ou par usage ?

Par usage. Deux utilisateurs peuvent consommer dans des proportions très différentes selon qu'ils posent des questions courtes ou lancent des agents sur des documents longs. Le budget par usage permet de fixer des plafonds cohérents et de repérer les dérives.

Où se situe SmartAGT

SmartAGT est vendu sous forme de licence logicielle annuelle par utilisateur, toutes capacités incluses. Vous signez en direct avec vos fournisseurs d'IA, et SmartAGT ne prend aucune marge sur l'inférence.

Le coût est suivi par agent, par modèle et par fournisseur, en monnaie réelle et non en crédits, avec les grilles tarifaires publiées par l'éditeur. Des quotas et plafonds par utilisateur, par groupe ou pour tous déclenchent des alertes, puis un blocage. Le POC se fait chez vous, avec vos modèles et vos données. Voir le modèle tarifaire.

SOUVERAIN PAR ARCHITECTURE

Une question que ces guides
ne tranchent pas ?