Avec le basculement rapide des grands éditeurs de logiciels de l’abonnement forfaitaire traditionnel vers une facturation à l’usage basée sur les tokens, les DSI font face à un changement de paradigme financier majeur. Sans une gouvernance rigoureuse et une maîtrise fine de cette nouvelle consommation, la prolifération incontrôlée de l’IA générative au sein des métiers menace de transformer une promesse d’efficacité en un gouffre budgétaire et opérationnel.

Pendant plus de deux décennies, le modèle économique du logiciel d’entreprise a reposé sur une métrique lisible, stable et prévisible : la licence SaaS attribuée par utilisateur et par mois. Ce cadre contractuel offrait aux DSI une visibilité budgétaire confortable, directement alignée sur la gestion des effectifs et le renouvellement des postes de travail. L’émergence rapide et l’industrialisation de l’IA générative sont en train de briser ce cadre protecteur.

Aujourd’hui, les géants de la tech et les éditeurs de logiciels font évoluer leurs grilles tarifaires vers une facturation basée sur la ressource « informatique » consommée. Ce passage d’un modèle d’abonnement forfaitaire strict à un système d’allocation et de facturation par crédits et tokens d’IA consommés marque une étape charnière pour l’ensemble du marché. Désormais, chaque sollicitation de modèle, chaque génération de code, chaque synthèse de document et chaque itération d’agent autonome se traduit par une consommation comptabilisée au million de tokens en entrée, en sortie ou en mémoire cache.

Dans ce nouvel environnement, la dynamique de dépense s’inverse. La charge financière ne dépend plus du nombre de collaborateurs déclarés dans un contrat, mais de la fréquence, du volume et de la complexité des requêtes exécutées à chaque minute. Durant les phases d’expérimentation ou de preuve de concept (POC), cette réalité est souvent masquée par des crédits de bienvenue accordés par les fournisseurs du Cloud ou par des budgets d’innovation temporaires. Cependant, dès que les outils d’IA sont intégrés dans les flux de travail quotidiens ou branchés sur des processus métiers automatisés, les volumes explosent et la facture d’API rattrape brutalement les directions financières.

Les facteurs invisibles de la dérive budgétaire

La dérive budgétaire liée aux tokens ne provient pas d’une hausse soudaine des tarifs unitaires des éditeurs, mais d’une accumulation de pratiques inefficaces lors de la conception et de l’utilisation des solutions d’IA. Contrairement aux logiciels traditionnels dont le coût d’exécution reste fixe quelle que soit son utilisation, l’IA générative pénalise financièrement chaque surplus d’information inutile injecté dans le système.

On identifie aujourd’hui quatre mécanismes principaux d’inflation des tokens au sein des entreprises :

  • La sur-dimension des consignes système (Prompt Inflation) : pour garantir qu’un modèle respecte la charte de l’entreprise ou un format précis, les équipes développent des consignes de cadrage (system prompts) de plus en plus longues. Rédigées sans recherche de sobriété, truffées de redondances et de règles contradictoires accumulées au fil du temps, ces consignes peuvent atteindre plusieurs milliers de tokens. Comme elles sont renvoyées à chaque appel d’API, elles multiplient le coût de base de chaque requête par dix ou par cent sans apporter la moindre valeur métier supplémentaire.
  • L’illusion des fenêtres de contexte géantes : les éditeurs mettent en avant des capacités d’absorption de contexte de plus en plus gigantesques (plusieurs millions de tokens). La tentation est alors grande de « tout injecter » dans la requête : l’intégralité d’un dossier client, des bases de code entières ou des historiques complets de messagerie. Cette pratique transforme chaque requête courante en un traitement lourd et très onéreux.
  • Le piège des architectures agentiques non bornées : l’émergence des agents autonomes — capables de planifier des tâches, de solliciter des outils externes et d’exécuter des boucles d’auto-correction — démultiplie l’usage des tokens. Sans plafond budgétaire strict au niveau du collaborateur, un agent confronté à une donnée ambiguë peut tourner en boucle, réinjecter l’ensemble de ses historiques d’erreurs et consommer des millions de tokens en quelques minutes sur un cas marginal.
  • Le choix systématique des modèles d’élite : par simplicité ou manque de gouvernance, de nombreux projets orientent l’intégralité de leurs flux vers les modèles les plus puissants du marché (les modèles « frontières »), même pour des tâches élémentaires de classification, de formatage ou d’extraction de texte qui pourraient être exécutées par des modèles spécialisés ou « flash » à une fraction du prix.

Pourquoi « plus de tokens » ne veut pas dire « meilleur résultat »

Pour justifier ces consommations massives, une idée reçue persiste chez de nombreux utilisateurs : plus le contexte fourni au modèle est volumineux, plus la réponse sera précise et pertinente. La recherche en ingénierie de l’IA et les retours d’expérience du terrain démontrent précisément l’inverse.

Le phénomène documenté sous le nom de Lost in the Middle prouve que l’attention des grands modèles de langage se concentre prioritairement au début et à la fin des fenêtres de contexte très longues. Lorsqu’un document de plusieurs centaines de pages est soumis à un modèle, les informations situées dans le corps du texte sont fréquemment ignorées ou mal interprétées. Encombrer un modèle avec des volumes massifs de données non filtrées augmente mécaniquement le risque de confusion, de contradictions internes et d’hallucinations.

De même, forcer un modèle à dérouler des chaînes de raisonnement verbeuses pour des tâches simples de structuration de données augmente la probabilité de dérive factuelle. Dans la majorité des cas d’usage d’entreprise, la qualité du résultat dépend de la précision et de la densité de l’information transmise, et non de la quantité brute de jetons injectés. Le cumul indésirable de tokens ne représente pas un gage de performance, mais une dette technique et financière directe.

Si l’impact financier immédiat constitue le signal d’alarme le plus visible pour les directions financières, l’absence de maîtrise des tokens génère des conséquences néfastes sur l’ensemble de l’écosystème IT de l’entreprise.

La dégradation de la performance applicative

Sur les architectures de type Transformer, le temps de traitement de l’inférence augmente avec le volume de tokens traités en entrée et générés en sortie. Une requête inutilement alourdie se traduit par un temps de réponse prolongé pour l’utilisateur final. Dans des applications métiers critiques (support client en direct, assistance aux ventes, outils de saisie opérationnels), cette latence dégrade l’expérience utilisateur, réduit l’adoption des outils et provoque des violations directes des engagements de service (SLA).

La saturation des infrastructures et des quotas

Que l’entreprise utilise des API partagées ou des instances réservées sur le Cloud, la capacité de calcul GPU reste limitée. La consommation de requêtes surdimensionnées monopolise la mémoire vive des accélérateurs et engorge les files d’attente. Ce phénomène réduit le nombre de requêtes simultanées que l’entreprise peut traiter et contraint la DSI à sur-dimensionner ses réservations d’infrastructures pour pallier le manque d’efficience des requêtes.

L’impact environnemental et la responsabilité RSE

Chaque token généré ou analysé nécessite l’exécution de milliards d’opérations mathématiques au sein des centres de données, entraînant une consommation d’électricité et d’eau pour le refroidissement. Alors que les entreprises doivent désormais répondre à des exigences réglementaires strictes en matière de trajectoire carbone (notamment sur le bilan Scope 2 et 3), le gaspillage de tokens constitue une dérive écologique directe. La sobriété numérique ne concerne plus seulement le recyclage du matériel ou la mise en veille des serveurs, mais s’étend désormais à la sobriété algorithmique et à l’optimisation des requêtes d’IA.

Le constat est clair : la gestion des tokens ne peut plus être considérée comme un simple détail d’implémentation laissé à la discrétion des développeurs ou des utilisateurs individuels. En l’absence de visibilité et d’outils d’imputation analytique au niveau des projets ou des directions métiers, la DSI s’expose à un risque de perte de contrôle budgétaire totale.

Pour l’éviter l’entreprise doit faire évoluer sa posture : passer d’une consommation d’IA passive et subie à un pilotage éclairé, responsabilisé et structuré. C’est tout l’enjeu du passage de l’expérimentation sauvage à une gouvernance FinOps dédiée à l’IA d’entreprise.

Comprendre la facturation de l’IA : les 4 composantes d’un coût de token

Pour piloter efficacement ses dépenses d’IA générative, la DSI doit décomposer le coût d’une requête en quatre variables tarifaires distinctes :

  1. Les tokens d’entrée (Input Tokens) : le volume de texte, de code ou d’instructions envoyé au modèle. C’est le périmètre sur lequel l’optimisation des consignes et du contexte a le plus d’impact immédiat.
  2. Les tokens de sortie (Output Tokens) : le volume de texte généré par le modèle. Généralement facturés entre 3 et 5 fois plus cher que les tokens d’entrée, ils doivent faire l’objet de consignes de concision strictes.
  3. Les tokens en cache (Cached Input Tokens) : tarifs réduits proposés par certains fournisseurs lorsque des consignes système fixes sont réutilisées fréquemment. Une opportunité d’optimisation architecturale majeure.
  4. Les jetons de raisonnement (Reasoning Tokens) : utilisés par les modèles de réflexion avancée pour construire leurs réponses étape par étape. Très coûteux, ils doivent être réservés exclusivement aux problèmes d’architecture et de logique complexe.