IA

Los costes de inferencia volvieron a caer este trimestre, pero no para todos

Los precios por token que acaparan los titulares siguen bajando. Las cargas de trabajo con contextos largos y un uso intensivo de herramientas avanzan en la dirección contraria, y esa brecha está reconfigurando las hojas de ruta de producto.

DO

Por Daniel Okafor

AI & Infrastructure Editor · Publicado · Actualizado · 6 min de lectura

Claves

  • El precio medio de inferencia por token ha caído de forma sustancial respecto a hace un año
  • Las cargas de trabajo con contextos largos y un uso intensivo de herramientas no han registrado el mismo descenso de costes
  • Los equipos están elaborando sus presupuestos en función de las tareas completadas, en lugar del precio por token
Brazo robótico trabajando en una luminosa instalación automatizada
Brazo robótico trabajando en una luminosa instalación automatizada · Imagen ilustrativa

La narrativa de los tokens baratos es cierta, pero incompleta. En promedio entre distintos proveedores, la generación sencilla de texto es considerablemente más barata que hace un año. Las cargas de trabajo que mantienen abiertos contextos amplios, invocan herramientas repetidamente o ejecutan razonamientos en profundidad no han seguido esa curva.

Por qué los promedios inducen a error

Los equipos que desarrollan asistentes pagan por reintentos, rondas de verificación y una sobrecarga de orquestación que nunca aparece en una comparativa de precio por millón de tokens. Varios responsables de producto elaboran ahora sus presupuestos en función de las tareas completadas, y no de los tokens.

La consecuencia práctica es que la arquitectura determina el coste. El uso de caché, los modelos de enrutamiento más pequeños y unos límites estrictos para las salidas están aportando más a la economía unitaria que cualquier descuento de un proveedor.

Por qué importa

Los equipos de producto de IA afrontan costes crecientes en las cargas de trabajo complejas pese al descenso de los precios de referencia, lo que les obliga a tomar decisiones de arquitectura para controlar el gasto. Los proveedores que ofrecen descuentos uniformes por token pueden estar infravalorando los costes reales de las aplicaciones con un uso intensivo del razonamiento.

Fuentes y referencias

  • Vendor price sheets
  • Actualizado 16 sept 2026 · 16:20 UTC
  • Borrador elaborado con ayuda de IA, editado y verificado antes de su publicación · Revisado por Advisable Desk.
  • Edición traducida. Los datos y las fuentes coinciden con el original en inglés; la redacción se ha adaptado para ofrecer una lectura natural. Leer el original en inglés

En esta noticia

  • Inference pricing

Compartir esta noticia

Noticias relacionadas

Boletín diario

Un correo cada mañana. Las noticias que realmente influyen en las decisiones.

Cinco minutos de noticias sobre e-commerce, IA, pagos, negocios y startups, editadas por personas y enviadas antes de la apertura de los mercados.

Sin spam. Date de baja con un solo clic.