IA

Les coûts d’inférence ont encore baissé ce trimestre — mais pas pour tout le monde

Les tarifs affichés par token continuent de diminuer. Les workloads à contexte long et faisant un usage intensif d’outils évoluent dans la direction opposée, et cet écart redessine les feuilles de route produit.

DO

Par Daniel Okafor

AI & Infrastructure Editor · Publié le · Mis à jour le · 6 min de lecture

XInE-mail

À retenir

  • Le prix moyen de l’inférence par token a sensiblement baissé par rapport à il y a un an
  • Les charges de travail à long contexte et faisant un usage intensif d’outils n’ont pas bénéficié des mêmes baisses de coûts
  • Les équipes établissent désormais leurs budgets en fonction de l’achèvement des tâches plutôt que du prix par token
Bras robotisé à l’œuvre dans une installation automatisée lumineuse
Bras robotisé à l’œuvre dans une installation automatisée lumineuse · Image d’illustration

Le discours sur les tokens bon marché est fondé, mais incomplet. En moyenne, tous fournisseurs confondus, la génération de texte simple coûte nettement moins cher qu’il y a un an. Les workloads qui maintiennent ouverts de vastes contextes, sollicitent des outils à répétition ou exécutent des raisonnements approfondis n’ont pas suivi la même courbe.

Pourquoi les moyennes sont trompeuses

Les équipes qui développent des assistants paient pour les nouvelles tentatives, les passes de vérification et les surcoûts d’orchestration, autant d’éléments qui n’apparaissent jamais dans une comparaison du prix par million de tokens. Plusieurs responsables produit établissent désormais leur budget en fonction des tâches menées à bien plutôt que du nombre de tokens.

Conséquence concrète : l’architecture est un choix économique. La mise en cache, les modèles de routage plus petits et les limites de sortie strictes contribuent davantage à l’économie unitaire que n’importe quelle remise accordée par un fournisseur.

Pourquoi c’est important

Les équipes développant des produits d’IA font face à une hausse des coûts pour les charges de travail complexes, malgré la baisse des tarifs affichés, ce qui les oblige à faire des choix d’architecture pour maîtriser les dépenses. Les fournisseurs proposant des remises forfaitaires sur les tokens peuvent sous-estimer les coûts réels des applications nécessitant beaucoup de raisonnement.

Sources et références

  • Vendor price sheets
  • Mis à jour le 16 sept. 2026 · 16:20 UTC
  • Brouillon assisté par l’IA, relu et vérifié avant publication · Relu par Advisable Desk.
  • Édition traduite. Les faits et les sources sont identiques à ceux de l’original anglais ; la formulation est adaptée pour une lecture naturelle. Lire l’original en anglais

Dans cet article

  • Inference pricing

Partager cet article

XInE-mail

Articles liés

Réseau abstrait de nœuds lumineux dans un centre de données
IA

Le checkout agentique reconfigure discrètement la porte d’entrée du commerce en ligne

Les assistants capables de naviguer, de comparer et d’acheter pour le compte d’un consommateur passent de la démonstration à la production. Les distributeurs font désormais face à une question plus épineuse que celle de l’adoption : qui maîtrise la relation client lorsque c’est un logiciel qui clique ?

Daniel Okafor · il y a 6 h · 7 min de lecture

Brief quotidien

Un e-mail chaque matin. Les informations qui influencent réellement les décisions.

Cinq minutes d’actualité sur l’e-commerce, l’IA, les paiements, les entreprises et les startups, sélectionnée par des humains et envoyée avant l’ouverture des marchés.

Aucun spam. Désabonnement en un clic.