Durante los dos últimos años, la pregunta clave en el ámbito de la IA era sencilla: ¿Cuál es el modelo más inteligente? Esa cuestión está perdiendo importancia. La capa de modelos se está convirtiendo en un producto básico a un ritmo más rápido de lo previsto, y las brechas de capacidad que antes tardaban un año en subsanarse ahora se reducen en un trimestre —a menudo gracias a avances de ingeniería ajenos al propio modelo—. Por lo tanto, está surgiendo una nueva variable en la matriz de decisión sobre la IA: ¿Cuánto cuesta una ficha?
El token ha evolucionado mucho más allá de su definición técnica como unidad inferior a la palabra.
- A un agente, un token es la unidad fundamental de trabajo.
- A un director financiero, un token constituye un gasto de explotación emergente.
- Al mercado, un token se comporta cada vez más como una mercancía negociable, con distintos proveedores, precios, mecanismos de enrutamiento e incluso instrumentos financieros emergentes.
Nuestra tesis central es sencilla: La economía de tokens es, en esencia, una economía de energía enmascarada tras el software.. A medida que las capacidades de los modelos se vayan equiparando, la capacidad de generar y distribuir tokens fiables a un coste menor y más predecible se convertirá en una fuente cada vez más importante de ventaja competitiva.
Los agentes han transformado la economía de la IA
Las interfaces de chat tradicionales imponían un límite natural al uso de la IA: Los seres humanos son lentos. Un usuario formula una pregunta, espera una respuesta, la lee y formula la siguiente pregunta. La interacción humana, por lo tanto, actúa como un limitador del consumo de tokens.
Los agentes retiran ese limitador de velocidad. Un agente de programación puede planificar una tarea, examinar archivos, invocar herramientas, ejecutar comandos, evaluar resultados, corregir errores y repetir el proceso. Cada iteración puede ampliar el contexto que se devuelve al modelo. Según las estimaciones del sector, las cargas de trabajo de los agentes suelen situarse en Entre 10 y 50 veces el consumo de tokens de las interacciones tradicionales de un solo turno, dependiendo de la tarea.
Esto cambia la dinámica económica de la IA. A medida que aumenta la adopción de agentes, el consumo de tokens depende cada vez menos del uso humano y cada vez más de ejecución en máquina. El mercado ya está reaccionando: el uso intensivo ha obligado a productos de IA como Cursor y Claude Code a replantearse los modelos de suscripción fija, la introducción de límites de uso o de cargos adicionales cuando un número reducido de usuarios consume una cantidad desproporcionadamente elevada de recursos informáticos.
La respuesta lógica es enrutamiento multimodelo. No todos los pasos del flujo de trabajo de un agente requieren un modelo de vanguardia. La planificación compleja puede asignarse a un modelo de alta calidad, mientras que la recuperación, la síntesis, la clasificación o la ejecución de herramientas rutinarias pueden gestionarse mediante modelos más pequeños y económicos. Marcos de investigación como RouteLLM y FrugalGPT han demostrado que Es posible lograr reducciones sustanciales de los costes sin sacrificar proporcionalmente el rendimiento.
Aquí es donde el arnés de agente adquiere una importancia estratégica. El «harness» —la capa encargada de la planificación, la coordinación de herramientas, la gestión del contexto, la recuperación ante errores y las integraciones— puede compensar las deficiencias del modelo subyacente.
Por lo tanto, una mejor ingeniería puede reducir la brecha práctica entre los costosos modelos de vanguardia y las alternativas más económicas.
Las consecuencias son importantes: La ventaja del modelo en materia de inteligencia se está reduciendo, mientras que los aspectos económicos de la inferencia están cobrando mayor importancia.
El almacenamiento en caché pone de manifiesto el coste físico de un token
El enrutamiento es solo una de las facetas de la optimización de tokens. Almacenamiento en caché de las indicaciones ataca al otro: el cálculo redundante.
Los flujos de trabajo de los agentes envían repetidamente las mismas indicaciones del sistema, definiciones de herramientas y contexto persistente. En lugar de volver a calcular estos tokens cada vez, los proveedores pueden almacenar en caché los estados clave-valor subyacentes y reutilizarlos.
Los principales proveedores ofrecen ahora importantes descuentos por el almacenamiento en caché de los datos de entrada, en algunos casos acercándose a 90%. El precio exacto varía en función del modelo y la duración de la caché, pero el principio económico es el mismo: si el cálculo ya se ha realizado, su reutilización posterior supone un coste considerablemente menor.
Esta distinción es importante porque un El descuento de caché del 90% no es lo mismo que la tasa de aciertos de caché del 90%. Si se almacenan en caché 90% de tokens y estos solo cuestan 10% del precio de catálogo, el coste medio es de aproximadamente 19% del precio original: un ahorro efectivo de aproximadamente 80%.
Para la planificación financiera empresarial, estas distinciones son importantes. La economía de los tokens no se reduce simplemente al precio de catálogo, sino que se refiere al coste unitario efectivo en condiciones reales de trabajo.
El almacenamiento en caché también pone de manifiesto algo más profundo. ¿Por qué resulta más económico un token almacenado en caché? Porque requiere menos cálculo. Menos cálculo significa menos ciclos de GPU. Los ciclos de GPU consumen electricidad. En otras palabras, El precio de un token refleja, en última instancia, la infraestructura física..
Un token es electricidad cristalizada
A nivel de infraestructura, el precio de un token tiene en cuenta las GPU y su amortización, la capacidad del centro data, las redes, la refrigeración y, sobre todo, electricidad.
El desglose exacto de los costes varía en función de la arquitectura y la metodología contable, pero la tendencia es clara: a medida que aumenta la escala de la inferencia de la IA, La energía se está convirtiendo en una de las limitaciones más importantes para la viabilidad económica de la inteligencia..
Las cifras ya son significativas. Una interacción típica con la IA puede consumir tan solo una fracción de un vatio-hora, pero si se multiplica por cientos de miles de millones de interacciones y se amplifica mediante flujos de trabajo de agentes que implican razonamientos repetidos y llamadas a herramientas, la demanda total resulta enorme.
La Agencia Internacional de la Energía prevé que el consumo mundial de electricidad se acerque a 950 TWh para 2030, lo que supone casi el doble de los niveles de 2025.
Por consiguiente, la geografía es un factor importante. Los precios de la electricidad industrial varían considerablemente entre los principales mercados de IA, mientras que China ha ampliado la generación de energía renovable a un ritmo extraordinario y ha realizado importantes inversiones en las regiones occidentales, ricas en recursos energéticos, a través de su estrategia “East Data, West Computing”.
La inteligencia de software puede ampliarse a escala mundial en cuestión de meses, pero electricidad barata y fiable No es posible. La construcción de capacidad de generación, infraestructura de transmisión y centros data requiere años de inversión de capital. A medida que las capacidades de los modelos se vuelven cada vez más sustituibles, el acceso a una capacidad de cálculo abundante y de bajo coste se convierte en una ventaja más duradera.
Los tokens convierten la energía en un servicio comercializable a nivel mundial
La electricidad, en sí misma, es difícil de exportar a otros países. Las redes eléctricas siguen siendo, en esencia, regionales. Los tokens resuelven este problema.
En el interior de un centro data, la electricidad se convierte en potencia de cálculo. La potencia de cálculo se convierte en tokens. A continuación, los tokens pueden transmitirse al instante a través de API y redes de fibra óptica a usuarios de cualquier parte del mundo. Por lo tanto, el token es una forma de energía digitalizada: energía física transformada en un servicio que puede distribuirse a escala mundial.
Esto ayuda a explicar la creciente competitividad de los modelos chinos de inteligencia artificial. Las estimaciones del sector indican que los costes de inferencia de los principales modelos chinos pueden ser considerablemente inferiores a los de sus equivalentes occidentales, aunque la diferencia exacta varía en función del modelo, el proveedor y la carga de trabajo.
La reacción del mercado es cada vez más evidente. OpenRouter y otras plataformas de enrutamiento permiten a los desarrolladores comparar modelos en función del precio, la latencia y el rendimiento, así como redirigir el tráfico de forma dinámica. Los modelos chinos han ganado una cuota significativa del tráfico enrutado, mientras que los modelos de ponderación abierta, como Qwen y DeepSeek, han adquirido cada vez más protagonismo en los ecosistemas globales de desarrolladores.
Esto no significa que los modelos de vanguardia occidentales estén perdiendo relevancia. Los modelos de gama alta siguen teniendo poder de fijación de precios para el razonamiento complejo y de alto riesgo. En cambio, el mercado se está bifurcando: los modelos de vanguardia más caros se encargan de las cargas de trabajo cognitivas de mayor valor, mientras que los modelos más económicos se ocupan del volumen mucho mayor de inferencias rutinarias.
Por lo tanto, la cuestión estratégica ya no se reduce simplemente a quién cuenta con el modelo más eficaz. Se trata cada vez más de ”¿Quién puede proporcionar el nivel de inteligencia requerido al menor coste unitario fiable??”
Los pesos abiertos aceleran la mercantilización
Los proveedores de modelos chinos también han adoptado una estrategia comercial diferente: pesos libres.
DeepSeek, Qwen, GLM, Kimi y otras familias de modelos chinos han publicado, en mayor o menor medida, sus pesos para su descarga, a menudo bajo licencias permisivas. Por el contrario, Los principales proveedores occidentales siguen centrándose principalmente en ecosistemas de API cerrados.
Ambos enfoques reflejan modelos económicos distintos. Los modelos cerrados monetizan las capacidades cognitivas escasas mediante el acceso exclusivo. Los modelos de peso abierto utilizan el propio modelo como mecanismo de adopción, desplazando la competencia hacia las fases posteriores del proceso, concretamente hacia la infraestructura de inferencia, los servicios cloud, las herramientas para desarrolladores, el ajuste fino y la integración empresarial.
El lanzamiento de DeepSeek-R1 en enero de 2025 supuso un importante punto de inflexión. A medida que los pesos de los modelos de alto rendimiento se hacían cada vez más accesibles, el propio modelo base dejó de constituir una ventaja competitiva tan significativa.
Una vez que los coeficientes del modelo se acercan a un coste marginal de distribución igual a cero, El campo de batalla competitivo se traslada a la economía de la inferencia y al ámbito empresarial. Esta es la esencia de la mercantilización: cuando la inteligencia se vuelve abundante, los recursos escasos se desplazan a otros ámbitos.
La economía de los tokens se asemeja cada vez más a un mercado de materias primas
La estructura que está surgiendo en torno a los tokens ya se asemeja a un mercado de materias primas consolidado:
- Diferenciación de precios: Un mismo modelo puede tener costes de inferencia muy diferentes en función del proveedor, la región y la infraestructura.
- Enrutamiento y arbitraje: Plataformas como OpenRouter permiten a los usuarios seleccionar dinámicamente entre distintos modelos y proveedores en función del precio, la latencia y el ancho de banda.
- Precios por niveles: Los proveedores diferencian cada vez más los precios en función de la prioridad, la rapidez, el procesamiento por lotes y la capacidad garantizada.
- Cuotas y asignación: Los límites de uso y los niveles de servicio para empresas permiten asignar de forma eficaz los recursos informáticos limitados en función del valor y la demanda de los clientes.
- Financiarización: Los índices emergentes y los futuros informáticos apuntan hacia un futuro en el que las empresas podrían gestionar su exposición informática de forma muy similar a como gestionan otros costes variables de los insumos.
El resultado es una rápida compresión del ciclo de las materias primas. El enrutamiento, el almacenamiento en caché, la sustitución de modelos y la electricidad de bajo coste resuelven, en definitiva, el mismo problema subyacente: Cómo minimizar el coste de la información útil facilitada. Y en los mercados de materias primas, lo que realmente importa, en última instancia, es la rentabilidad por unidad.
La perspectiva de Artefact: Las empresas deben gestionar su economía de tokens
Por lo tanto, para las empresas, la economía de los tokens debería convertirse en una disciplina de gestión, y no simplemente en una cuestión de infraestructura.
1. Considere los tokens como una cuestión relacionada con FinOps: El coste de la IA debe estar vinculado a los resultados empresariales. ¿Cuántos tokens se necesitan para resolver un ticket de asistencia? ¿Cuál es el coste en tokens de una solicitud de incorporación de cambios automatizada? ¿Cuál es el coste combinado de la IA por interacción con el cliente? Sin esta atribución, las empresas no pueden distinguir entre el uso productivo de la IA y el despilfarro.
2. Convierta el enrutamiento multimodelo en un principio arquitectónico: Los modelos de vanguardia no deberían ser la opción predeterminada para todas las tareas. Las empresas deberían adaptar dinámicamente la capacidad del modelo a la complejidad de la tarea, con el apoyo de un enrutamiento inteligente, el almacenamiento en caché y la observabilidad. El valor duradero residirá cada vez más fuera del modelo: flujos de trabajo propios, contexto empresarial, lógica de coordinación, experiencia en el sector y data de confianza.
3. Evalúe los tokens chinos de forma pragmática: La creciente diferencia de costes entre los modelos chinos y los occidentales merece un análisis riguroso, especialmente en el caso de las cargas de trabajo de gran volumen y baja sensibilidad.
En el caso de los datos sensibles data, los modelos de peso abierto implementados en entornos privados o soberanos pueden proporcionar un mayor control sobre la ubicación de los datos data y la infraestructura. Para tareas estandarizadas y de alta frecuencia, los puntos finales de API rentables pueden ofrecer mejoras significativas en la rentabilidad unitaria.
4. Incorporar la reducción de los costes de los modelos a los modelos de negocio: Los precios de los modelos seguirán bajando. Por lo tanto, los márgenes sostenibles dependerán menos del acceso a la información bruta y más de integración de flujos de trabajo, la solución propia data, orquestación, experiencia en el sector y confianza de los clientes.
5. Incluya la energía en la agenda de la estrategia de inteligencia artificial: Para las empresas tecnológicas, los proveedores de cloud, los fabricantes y los responsables políticos, la infraestructura de IA ya no puede separarse de la estrategia energética. Es posible que la próxima ventaja competitiva no provenga de contar con el modelo más avanzado, sino de garantizar recursos informáticos abundantes, resistentes y asequibles.
Conclusión: El paso de «inteligente» a «alta calidad/bajo coste»
El principal eje competitivo de la IA ha pasado de “¿Qué modelo es el más inteligente?” a “¿Quién puede crear y distribuir tokens de alta calidad al menor coste??”
Dado que, en última instancia, un token no es más que potencia de cálculo y electricidad materializadas, el panorama futuro del dominio de la IA no vendrá determinado únicamente por los laboratorios de investigación de élite, sino por la distribución de una infraestructura energética abundante, de bajo coste y resiliente.

BLOG





