Calculadora de Tokens para IA
Estima tokens y coste de API para GPT-4o, Claude, Gemini, Llama y más modelos de IA.
Texto de entrada (prompt)
Pega o escribe tu prompt. Los tokens se estiman en tiempo real.
Selecciona el modelo
Precios en USD/millón de tokens. Actualizado junio 2025.
Resultado
Comparativa con todos los modelos
| Modelo | Proveedor | Coste entrada | Coste salida | Total | Barra |
|---|
Coste a escala (modelo seleccionado)
Precios de referencia de los principales modelos
Precios en USD por millón de tokens (MTok). Última actualización: junio 2025. Consulta las páginas de los proveedores para precios exactos y actualizados.
| Modelo | Proveedor | Entrada ($/MTok) | Salida ($/MTok) | Contexto |
|---|
¿Cómo se cuentan los tokens en los modelos de IA?
Los grandes modelos de lenguaje (LLM) no procesan texto carácter a carácter ni palabra a palabra, sino en tokens: fragmentos de texto que pueden ser una sílaba, una palabra completa o un signo de puntuación. El tokenizador más usado es Byte-Pair Encoding (BPE), que aprende durante el entrenamiento qué secuencias de caracteres aparecen juntas con más frecuencia.
Regla práctica para estimar tokens
- Inglés: ≈ 1 token por cada 4 caracteres o ¾ de palabra
- Español / francés / alemán: ≈ 1 token por cada 3–4 caracteres (palabras más largas = más tokens)
- Código: muy variable; los identificadores cortos son eficientes, los comentarios en prosa son costosos
- Chino / japonés / coreano: ≈ 1–2 caracteres por token (caracteres compuestos)
Fórmula del coste de una llamada API
Coste = (tokens_entrada × precio_in + tokens_salida × precio_out) ÷ 1 000 000
¿Qué es la ventana de contexto?
La ventana de contexto (context window) es el número máximo de tokens que el modelo puede «ver» en una sola llamada, incluyendo el historial de conversación, el system prompt y la respuesta. Si superas este límite, el modelo descartará los tokens más antiguos o devolverá un error. GPT-4o tiene 128 K, Claude 3.5 Sonnet 200 K y Gemini 1.5 Pro llega a 1 M de tokens.
Preguntas frecuentes
¿Por qué mi texto en español genera más tokens que en inglés?
Los tokenizadores de los modelos actuales fueron entrenados principalmente con texto en inglés, por lo que las subunidades de vocabulario están optimizadas para ese idioma. Las palabras en español tienen morfología más compleja (conjugaciones, prefijos, sufijos, acentos) y se fragmentan en más tokens. Esto hace que el coste por palabra sea ligeramente mayor en español que en inglés para la misma cantidad de información.
¿Qué es el coste de caché (cached input)?
Algunos proveedores como Anthropic y OpenAI ofrecen prompt caching: si envías el mismo system prompt repetidamente, los tokens en caché se cobran a un precio reducido (típicamente un 50-90% menos). Es muy útil en aplicaciones con un system prompt largo y fijo, como chatbots con instrucciones detalladas. Esta calculadora muestra el precio sin caché.
¿Los tokens de imagen se cuentan igual que los de texto?
No. Las imágenes tienen su propio sistema de tokenización. OpenAI cobra por «tiles» de 512×512 píxeles; Anthropic cobra por imagen según resolución (una imagen típica de 1024×1024 cuesta aproximadamente 1600 tokens). Esta calculadora solo estima tokens de texto.
¿Llama 3 o Mistral son gratis?
Los pesos de Llama 3 (Meta) y Mistral son de código abierto y puedes ejecutarlos en tu propio hardware sin coste de API. Si los usas a través de servicios como Groq, Together AI o Replicate, sí existe un coste (generalmente más bajo que los modelos propietarios). Esta calculadora muestra precios orientativos de proveedores de inferencia populares.