Saltar al contenido

Inteligencia artificial

Cuánto cuesta la IA en una empresa: depende del modelo, no de la marca

El gerente o el financiero que va a pagar la factura de la inteligencia artificial y quiere saber de qué depende.

Escrito por
Laura · Equipo de Redacción de Mavox
Publicado
6 de octubre de 2026
Lectura
9 minutos

El lunes, la auxiliar contable sube al sistema las cuatrocientas facturas que llegaron el fin de semana. Hay dos maneras de que una inteligencia artificial las lea. Una usa el modelo más grande del mercado, le pide que piense a fondo cada documento y le pasa el PDF entero. La otra usa un modelo pequeño, le pide la respuesta directa y le pasa solo lo necesario. Las dos sacan el NIT, el total y la fecha. La primera puede costar decenas de veces más.

Cuando se habla del precio de la inteligencia artificial, la conversación suele quedarse en «¿cuánto cuesta ChatGPT?» o «¿cuál es la mejor IA?». La pregunta que mueve la factura es otra: ¿qué modelo, y cuánto razonamiento, para cada tarea?

Qué son los tokens y cómo se cobran

Los modelos se cobran por tokens. Un token es un pedazo de texto, más corto que una palabra, y cuántos ocupa una palabra cambia según el idioma y el modelo. Se paga por lo que el modelo lee (entrada) y por lo que escribe (salida), y en los tres grandes proveedores la salida cuesta entre cinco y ocho veces más que la entrada.

Dos detalles que no se ven en la factura y pesan:

  • El razonamiento se cobra como salida. Los modelos que piensan antes de responder escriben ese razonamiento aunque tú no lo veas, y la documentación de OpenAI, Anthropic y Google dice lo mismo: esos tokens se facturan como salida.
  • No todos los tokens son iguales. Anthropic advierte que desde Claude 4.7 su tokenizador produce cerca de un 30 % más de tokens para el mismo texto.

La licencia por usuario —la de ChatGPT Business o Claude Team— es otra cosa: sirve para que una persona converse con el asistente. Este artículo habla del costo cuando la IA trabaja dentro de un sistema, con cada documento leído y cada mensaje atendido.

Modelos de IA: cuánto cuesta el pequeño y cuánto el grande en ChatGPT, Claude y Gemini

Cada proveedor vende una familia de modelos, del más pequeño y rápido al más grande y capaz. Según sus páginas de precios oficiales, consultadas el 5 de octubre de 2026:

  • En Anthropic, Fable, su modelo más grande, cuesta 10 veces lo que Haiku, el más pequeño. Opus, el que la propia Anthropic recomienda para el razonamiento más complejo, cuesta 4 veces Haiku.
  • En OpenAI, dentro de su generación actual, el modelo más grande cuesta 100 veces lo que el más pequeño.
  • En Google, de Gemini Flash-Lite a Gemini Pro hay entre 5 y 8 veces, según qué versiones se comparen.

La regla de Anthropic, escrita en esa misma página de precios: el modelo pequeño para tareas simples, el intermedio para la mayoría del trabajo y el grande para el razonamiento más complejo.

Qué es un modelo de razonamiento, y por qué pensar de más cuesta

Además del tamaño, hoy se elige cuánto razona el modelo antes de responder. Anthropic lo llama effort, OpenAI reasoning effort y Google thinking level. Cada uno tiene su escala, y los tres permiten bajar o subir cuánto piensa el modelo.

Más razonamiento no siempre es mejor. En su guía para Opus 4.7, Anthropic advierte que el nivel máximo suma un costo significativo por ganancias de calidad relativamente pequeñas, y que puede llevar al modelo a pensar de más. Google recomienda el razonamiento mínimo o bajo para responder un dato puntual o para clasificar.

Dos estudios apuntan a lo mismo. Uno, de diciembre de 2024, titulado «No pienses tanto para 2+3», mostró que los modelos de razonamiento gastan cómputo de más en problemas simples, con un beneficio mínimo. Otro, de febrero de 2025, encontró en tareas de programación con agentes que escoger la respuesta que menos sobre-piensa mejora el desempeño casi un 30 % y baja el costo de cómputo un 43 %.

Pedirle a un modelo que piense a fondo para leer un NIT es pagar por pensar lo que se lee en un segundo.

Qué es el enrutamiento de modelos

Es mandar cada tarea al modelo más pequeño que la resuelve bien, y subir al grande solo lo difícil. Los estudios que lo midieron:

  • FrugalGPT (Stanford, 2023) encontró que una cascada de modelos puede igualar al mejor modelo individual con hasta un 98 % menos de costo.
  • RouteLLM (LMSYS, de UC Berkeley, 2024) logró reducciones de costo de entre 35 % y más de 85 % según la prueba, conservando el 95 % del desempeño de GPT-4.

Los propios proveedores dan la pauta general: Anthropic, el modelo pequeño para lo simple; Google, el razonamiento mínimo para responder un dato o clasificar. Traducido a cualquier oficina: traducir un correo o resumir un acta no necesita lo mismo que revisar las cláusulas de un contrato. Y hay tareas que no deberían ir a ningún modelo: sumar, liquidar o calcular una nómina lo hace mejor un motor, que da el mismo resultado siempre y no gasta tokens.

Caché y lote: las otras dos palancas

  • Caché. Cuando el sistema le manda al modelo las mismas instrucciones una y otra vez, esa parte se puede guardar. Si se repite dentro de unos minutos, leerla de la caché cuesta una décima parte de leer normal en Anthropic, o menos en sus modelos más grandes, y OpenAI habla de descuentos de hasta el 95 %. Escribir en la caché, en cambio, cuesta un poco más que leer normal.
  • Lote. Lo que no es urgente se puede mandar por lote y esperar la respuesta hasta un día. Los tres proveedores lo cobran a la mitad.

¿Cuál es la mejor IA para una empresa? ChatGPT, Claude o Gemini

Ninguna para todo. Los tres grandes proveedores tienen modelos pequeños, intermedios y grandes, y entre el pequeño y el grande de una misma marca hay más diferencia de precio que entre una marca y otra. Para leer y clasificar, gana el modelo más barato que acierte. Para razonar sobre un problema con varias piezas, el grande. La decisión útil no es la marca: es el tamaño y el razonamiento para cada tarea.

Por qué el token baja y la factura sube

El precio por token cae rápido. El AI Index de Stanford calculó que el costo de usar un modelo del nivel de GPT-3.5 bajó más de 280 veces entre noviembre de 2022 y octubre de 2024, y Andreessen Horowitz estima que, para un mismo nivel de desempeño, el costo baja unas diez veces cada año.

Y sin embargo las facturas suben. Gartner pronosticó en agosto de 2026 que el costo de inferencia por cada flujo de agentes se va a multiplicar por más de cinco hasta 2028, y le puso nombre: la paradoja de la inferencia. Cada token es más barato, pero los agentes usan muchos más. Un año antes, la misma firma había pronosticado que más del 40 % de los proyectos de IA agéntica se cancelarán antes de terminar 2027, con los costos crecientes entre las causas.

El precio por token no controla la factura. La controla quien decide qué modelo y cuánto razonamiento usa cada tarea.

Cómo lo hacemos en Mavox

Elegimos el modelo y el nivel de razonamiento para cada tarea que hace Mavox, y no usamos uno más grande del que la tarea necesita. Es una parte del producto en la que trabajamos todo el tiempo. Tú pones el tope:

  • El consumo de IA te lo factura el proveedor, al costo, sin margen nuestro y con el tope de gasto que tú decidas. Son centavos por cada factura leída o conversación atendida.
  • Si pones tu propia llave del proveedor de inteligencia artificial, ves el consumo en tu propia cuenta, con tu contrato.
  • Los cálculos no gastan tokens: la nómina, las retenciones y los saldos los calcula un motor.

El detalle está en Cómo cobramos.

Preguntas frecuentes

¿Cuánto cuesta usar IA en una empresa?

Depende de cómo se use. Si es para que las personas conversen con un asistente, se paga una licencia por usuario. Si la IA trabaja dentro de un sistema, se paga por tokens, y el costo depende más del modelo y del razonamiento que se elijan para cada tarea que de la marca.

¿Qué son los tokens en inteligencia artificial?

Los pedazos de texto en que un modelo lee y escribe. Se cobra por los que lee y por los que escribe, y los que escribe cuestan varias veces más.

¿Qué es un modelo de razonamiento?

Un modelo que piensa antes de responder. Ese razonamiento se cobra como salida aunque no lo veas, y en tareas simples casi no mejora la respuesta.

¿Qué es el enrutamiento de modelos?

Mandar cada tarea al modelo más pequeño que la resuelve bien y reservar el grande para lo difícil. Los estudios académicos que lo midieron encontraron ahorros de entre 35 % y 98 %.

¿Cuál es la mejor IA para una empresa?

Ninguna sirve para todo. Para leer y clasificar, el modelo más barato que acierte; para razonar sobre un problema complejo, el grande.

¿Cómo se controla el gasto en IA?

Con cuatro palancas: el modelo más pequeño que resuelva la tarea, el razonamiento justo, caché para lo que se repite y lote para lo que no es urgente. Y con un tope de gasto en la cuenta.

Lo que hay que saber

  • La IA se paga por tokens, y el razonamiento que no ves también se cobra.
  • Entre el modelo pequeño y el grande de un mismo proveedor hay de 5 a 100 veces de diferencia de precio.
  • Elegir el modelo y el razonamiento según la tarea es una de las palancas que más pesan en la factura, según los estudios que lo han medido.
  • El precio por token baja cada año; la factura no baja sola.

Para seguir leyendo

Pregúntanos cuánto consumiría tu operación

Trae el volumen de un mes —facturas, mensajes, conciliaciones— y te mostramos de qué depende tu consumo de IA.

Agenda una demo