Qué son los tokens y cuánto cuesta usar una API de IA
Cuando una aplicación llama a un modelo de lenguaje no paga por preguntas ni por palabras: paga por tokens, y cobra distinto lo que envías y lo que recibes. Esta guía explica qué es un token, por qué el español pesa más que el inglés, cómo estimar la factura de un mes con una fórmula y un ejemplo hecho a mano, y qué errores la multiplican sin que nadie lo note.
Un token no es una palabra: qué se mide y cómo se aproxima
Un token es un fragmento de texto: una palabra corta completa, un trozo de una palabra larga o un signo de puntuación. El modelo lee esa secuencia de fragmentos y el proveedor factura por cuántos procesa. Con la codificación o200k_base (la de GPT-4o) y la librería abierta gpt-tokenizer, «información» y «contraseña» ocupan 2 tokens cada una, y «anticonstitucionalmente» ocupa 5.
La calculadora de Redutil no usa un tokenizador real: divide los caracteres entre 3,5 y redondea hacia arriba. En tres frases en español de 288 caracteres la fórmula da 83 tokens, mientras que el tokenizador de GPT-4o cuenta 51 y el de GPT-4 y GPT-3.5 (cl100k_base) cuenta 59: en prosa se queda del lado prudente. En JSON el error va al revés: un objeto de 138 caracteres dio 48 tokens reales (2,88 caracteres por token) frente a los 40 que estima la fórmula; lo real superó a la estimación en un 20 %.
En prosa, la estimación es un techo razonable; para JSON o código, añade margen o mide con el contador del proveedor.
Por qué el español suele gastar más tokens que el inglés
Los vocabularios de los tokenizadores se construyeron con mucho más texto en inglés: las palabras inglesas frecuentes suelen ser un solo token y las españolas, con tildes, conjugaciones y terminaciones largas, se parten más. Además el español necesita más caracteres para decir lo mismo. Medimos tres pares de frases equivalentes (288 caracteres en español, 231 en inglés) con dos codificaciones.
La brecha existe, pero los tokenizadores nuevos la reducen: de +44 % a +24 % en esta muestra, que es pequeña y no una ley; otros proveedores usan tokenizadores propios. Mide tu propio texto antes de decidir nada.
| Codificación | Tokens en español | Tokens en inglés | Diferencia |
|---|---|---|---|
| cl100k_base (GPT-4, GPT-3.5) | 59 | 41 | +44 % |
| o200k_base (GPT-4o) | 51 | 41 | +24 % |
Entrada y salida se cobran a precios distintos
Los tokens de entrada son todo lo que envías: instrucciones, documentos, historial. Los de salida son lo que el modelo genera. Casi todos los proveedores fijan un precio por millón para cada uno, y la salida cuesta más. La tabla usa los datos que la calculadora de Redutil trae cargados a septiembre de 2026; las tarifas cambian, así que confirma en la página del proveedor antes de decidir.
Escenario: un prompt de 4.200 caracteres (1.200 tokens según la fórmula), 300 tokens de salida, 100 peticiones al día, 30 días. En estos datos la salida cuesta entre 2 y 5 veces más que la entrada, y entre el modelo más barato y el más caro hay 45 veces de diferencia mensual.
| Modelo | Entrada USD/M | Salida USD/M | Una petición | Un mes |
|---|---|---|---|---|
| Gemini 1.5 Flash | 0,075 | 0,30 | 0,00018 USD | 0,54 USD |
| DeepSeek V3 | 0,14 | 0,28 | 0,000252 USD | 0,756 USD |
| GPT-4o mini | 0,15 | 0,60 | 0,00036 USD | 1,08 USD |
| GPT-4o | 2,50 | 10,00 | 0,006 USD | 18,00 USD |
| Claude 3.5 Sonnet | 3,00 | 15,00 | 0,0081 USD | 24,30 USD |
Ventana de contexto: lo que cabe no es lo que conviene enviar
La ventana de contexto es el máximo de tokens que un modelo maneja en una llamada, entrada y salida incluidas. Cada proveedor publica la de cada modelo; consúltala en su documentación. Tiene dos consecuencias económicas.
Primera: las API no recuerdan nada. En un chat, tu aplicación reenvía la conversación completa en cada turno y cada reenvío se factura como entrada. Segunda: que un documento quepa no significa que deba ir entero. Si la respuesta depende de dos páginas de un manual de ochenta, mandarlo completo paga cuarenta veces la entrada necesaria.
La fórmula para estimar el costo mensual, con un ejemplo hecho a mano
Costo por petición = (tokens de entrada ÷ 1.000.000 × precio de entrada) + (tokens de salida ÷ 1.000.000 × precio de salida). Costo mensual = costo por petición × peticiones al día × 30. Es exactamente lo que calcula la herramienta.
Ejemplo con una tarifa hipotética, inventada solo para este cálculo: 1,00 USD por millón de tokens de entrada y 4,00 USD por millón de salida. Un asistente de atención al cliente envía 1.200 tokens de entrada, recibe 300 de salida y atiende 500 peticiones al día. Por petición: 0,0012 + 0,0012 = 0,0024 USD. Al mes: 0,0024 × 500 × 30 = 36 USD, unos 144.000 COP con el dólar a 4.000.
- La mitad del costo (18 USD) es entrada y la otra mitad es salida, aunque la salida sea solo el 20 % de los tokens (300 de 1.500).
- Si las respuestas se duplican a 600 tokens, el mes sube a 54 USD: un 50 % más.
Palancas de ahorro y cuándo usar cada una
La caché de prompts: cuando muchas peticiones comparten un comienzo largo (instrucciones, ejemplos, un manual), algunos proveedores permiten reutilizar ese prefijo ya procesado y cobrarlo distinto en llamadas posteriores. El patrón de diseño es común: lo estable va primero y lo variable, como la pregunta del usuario, al final. El procesamiento por lotes: varios proveedores ejecutan tareas sin urgencia, como clasificar miles de reseñas, de forma diferida a cambio de esperar. No damos porcentajes de descuento porque cambian; revisa condiciones y tarifas en cada documentación.
| Palanca | Qué reduce | Cuándo conviene | Riesgo a vigilar |
|---|---|---|---|
| Modelo más pequeño | Precio por token | Clasificar, extraer datos, reformular | Baja la calidad en tareas complejas |
| Prompt más corto | Entrada | Instrucciones repetidas, documentos completos | Quitar contexto útil empeora la respuesta |
| Salida limitada | Salida, la parte más cara | Respuestas en formato fijo | Un tope bajo corta la respuesta |
| Caché de prompts | Entrada repetida | Prefijo largo y estable | Cambiar el prefijo impide reutilizarlo |
| Procesamiento por lotes | Precio por petición | Trabajos que no son urgentes | Hay espera; no sirve para chat |
| Recortar o resumir el historial | Entrada acumulada | Conversaciones largas | Se pierde contexto si borras |
Tres errores que disparan la factura sin avisar
El historial que crece. Supón instrucciones de 500 tokens, mensajes de usuario de 100 y respuestas de 200. En el turno n se envían 500 + (n − 1) × 300 + 100 tokens: en el décimo son 3.300 y la conversación paga 19.500 de entrada en total, aunque el contenido nuevo sume 3.500. A 30 turnos son 148.500. Con la tarifa hipotética de antes, cuesta 0,1725 USD; si solo reenvías los últimos tres intercambios, la entrada baja a 43.200 tokens y el costo a 0,0672 USD.
Los reintentos sin control. Cada reintento reenvía el prompt completo y vuelve a pagar la entrada. Fija un máximo de intentos, espera cada vez más entre uno y otro y registra cuántas llamadas fallan.
La salida sin tope. Sin un máximo de tokens de salida ni una petición de brevedad, una respuesta puede irse a 1.500 tokens cuando bastaban 300: cinco veces más gasto en la parte cara.
Cómo cerrar el cálculo con las herramientas de Redutil
En la calculadora de tokens y costos pega tu prompt real, no uno de juguete; usa una salida medida sobre respuestas reales y las peticiones del peor día razonable, y cambia la tasa COP, que por defecto es 4.000. Si construyes el prompt con el generador de prompts, ten presente que su plantilla añade unos 258 tokens fijos aun con campos de pocas palabras (medidos con o200k_base; la fórmula de la calculadora da 308); en llamadas masivas quizá quieras recortarla.
El generador de JSON Schema acota la salida con valores permitidos y longitudes máximas, y el contador de palabras comprueba que el límite de longitud que pides es realista.
Haz el cálculo con tus datos
Estas herramientas aplican lo que explica la guía, con la fórmula a la vista.
Calculadora de Tokens y Costos de APIs de IA
Cuenta tokens en tiempo real y calcula el costo mensual de consultas a GPT-4o, Claude, Gemini y DeepSeek.
Generador Visual de JSON Schema
Crea JSON, JSON Schema, Zod y prompts sin escribir una llave.
Generador de Prompts para IA
Crea prompts de nivel Senior para ChatGPT, Claude, Gemini y Midjourney sin pagar licencias.
Contador de Palabras y Convertidor de Texto
Cuenta palabras, caracteres, densidad de palabras clave y convierte a mayúsculas, título o slug SEO.
Preguntas frecuentes
- ¿Cuántos tokens tiene una página de texto en español?
- No hay cifra fija. Unos 2.000 caracteres dan alrededor de 570 tokens con la fórmula de la calculadora (3,5 caracteres por token) y entre 350 y 410 con los tokenizadores que probamos en prosa (de 4,9 a 5,6 caracteres por token). Para presupuestar usa la cifra alta; para la exacta, el contador del proveedor.
- ¿Por qué mi factura no coincide con lo que calcula la herramienta?
- La herramienta modela una petición típica repetida cada día. La factura real suma respuestas de longitud variable, historial reenviado, instrucciones de sistema y reintentos, y la estimación de tokens es aproximada. Compara una semana con el uso que reporta el proveedor y ajusta.
- ¿Conviene siempre el modelo más barato?
- No. Un modelo barato que falla obliga a reintentar o a revisar a mano, y eso también cuesta. Prueba cada modelo con unos cincuenta casos reales, mide cuántos salen bien y calcula el costo por resultado correcto, no por petición.
- ¿Cuánto ahorran la caché de prompts y el procesamiento por lotes?
- Depende del proveedor y cambia con el tiempo, por eso no damos porcentajes. Lo constante: la caché rinde cuando el comienzo del prompt es idéntico entre llamadas, y los lotes cuando puedes esperar el resultado. Si se combinan, y cómo, lo dice la documentación de cada proveedor.
- ¿Los modelos que razonan cobran también ese razonamiento?
- En varios proveedores, los modelos que piensan antes de responder facturan ese razonamiento como salida aunque no lo veas completo. Revisa en la documentación cómo se reporta y mira el uso real de tus primeras llamadas antes de proyectar el mes con los tokens visibles.
Fuentes
Esta guía es información general con fines orientativos y no constituye asesoría legal, tributaria, financiera ni médica. Las cifras y las normas cambian: verifícalas en la fuente oficial antes de tomar decisiones. Cómo trabajamos y cómo corregimos errores: política editorial.