Calculadora de Tokens para IA

Estima tokens y coste de API para GPT-4o, Claude, Gemini, Llama y más modelos de IA.

Publicidad

Texto de entrada (prompt)

Pega o escribe tu prompt. Los tokens se estiman en tiempo real.

Cargar ejemplo:

Selecciona el modelo

Precios en USD/millón de tokens. Actualizado junio 2025.

500 Ajusta según la longitud de respuesta esperada. Una respuesta típica oscila entre 200 y 1000 tokens.

Resultado

Tokens entrada
Tokens salida
Coste total
Desglose del coste
Tokens de entrada
Precio entrada (por MTok)
Coste de entrada
Tokens de salida (estimados)
Precio salida (por MTok)
Coste de salida
Ventana de contexto del modelo
COSTE TOTAL (1 llamada)

Comparativa con todos los modelos

Modelo Proveedor Coste entrada Coste salida Total Barra

Coste a escala (modelo seleccionado)

Publicidad

Precios de referencia de los principales modelos

Precios en USD por millón de tokens (MTok). Última actualización: junio 2025. Consulta las páginas de los proveedores para precios exactos y actualizados.

Modelo Proveedor Entrada ($/MTok) Salida ($/MTok) Contexto
Publicidad

¿Cómo se cuentan los tokens en los modelos de IA?

Los grandes modelos de lenguaje (LLM) no procesan texto carácter a carácter ni palabra a palabra, sino en tokens: fragmentos de texto que pueden ser una sílaba, una palabra completa o un signo de puntuación. El tokenizador más usado es Byte-Pair Encoding (BPE), que aprende durante el entrenamiento qué secuencias de caracteres aparecen juntas con más frecuencia.

Regla práctica para estimar tokens

  • Inglés: ≈ 1 token por cada 4 caracteres o ¾ de palabra
  • Español / francés / alemán: ≈ 1 token por cada 3–4 caracteres (palabras más largas = más tokens)
  • Código: muy variable; los identificadores cortos son eficientes, los comentarios en prosa son costosos
  • Chino / japonés / coreano: ≈ 1–2 caracteres por token (caracteres compuestos)

Fórmula del coste de una llamada API

Coste = (tokens_entrada × precio_in + tokens_salida × precio_out) ÷ 1 000 000

¿Qué es la ventana de contexto?

La ventana de contexto (context window) es el número máximo de tokens que el modelo puede «ver» en una sola llamada, incluyendo el historial de conversación, el system prompt y la respuesta. Si superas este límite, el modelo descartará los tokens más antiguos o devolverá un error. GPT-4o tiene 128 K, Claude 3.5 Sonnet 200 K y Gemini 1.5 Pro llega a 1 M de tokens.

Preguntas frecuentes

¿Por qué mi texto en español genera más tokens que en inglés?

Los tokenizadores de los modelos actuales fueron entrenados principalmente con texto en inglés, por lo que las subunidades de vocabulario están optimizadas para ese idioma. Las palabras en español tienen morfología más compleja (conjugaciones, prefijos, sufijos, acentos) y se fragmentan en más tokens. Esto hace que el coste por palabra sea ligeramente mayor en español que en inglés para la misma cantidad de información.

¿Qué es el coste de caché (cached input)?

Algunos proveedores como Anthropic y OpenAI ofrecen prompt caching: si envías el mismo system prompt repetidamente, los tokens en caché se cobran a un precio reducido (típicamente un 50-90% menos). Es muy útil en aplicaciones con un system prompt largo y fijo, como chatbots con instrucciones detalladas. Esta calculadora muestra el precio sin caché.

¿Los tokens de imagen se cuentan igual que los de texto?

No. Las imágenes tienen su propio sistema de tokenización. OpenAI cobra por «tiles» de 512×512 píxeles; Anthropic cobra por imagen según resolución (una imagen típica de 1024×1024 cuesta aproximadamente 1600 tokens). Esta calculadora solo estima tokens de texto.

¿Llama 3 o Mistral son gratis?

Los pesos de Llama 3 (Meta) y Mistral son de código abierto y puedes ejecutarlos en tu propio hardware sin coste de API. Si los usas a través de servicios como Groq, Together AI o Replicate, sí existe un coste (generalmente más bajo que los modelos propietarios). Esta calculadora muestra precios orientativos de proveedores de inferencia populares.