Economía de tokens

Por lo que realmente paga

Los tokens son la unidad de facturación de cada modelo de IA comercial, y casi nadie paga lo que espera. Esta herramienta tokeniza su texto de forma real y muestra los tres factores que determinan la factura: qué parte de la solicitud está pagando, cuánto de ella está pagando dos veces y en qué idioma la escribió.

Tokenizar cualquier cosa

Vocabulario
Probar
The farmer inspected the maize field yesterday morning
8
tokens
8
palabras
1.00
tokens por palabra
14
lo que dice la regla de 4 caracteres

Precio como
Como entrada (el modelo lo lee) - -
Como salida (el modelo lo escribe) - -
Como entrada en caché (tasa del 10%) - -

Por qué la salida cuesta aproximadamente 5 veces más que la entrada

Lectura del prompt

El modelo ve cada token de entrada a la vez y los procesa en una sola pasada paralela. Un prompt de 10,000 tokens no representa diez veces el trabajo de uno de 1,000 en términos de tiempo real, porque la GPU realiza operaciones matriciales amplias para las que está diseñada. El hardware se mantiene ocupado, por lo que el precio por token se mantiene bajo.

una pasada, todos los tokens juntos

Escritura de la respuesta

Cada token de salida requiere su propia pasada completa a través de todo el modelo y no puede comenzar hasta que exista el token anterior. El trabajo es secuencial y limitado por la memoria, por lo que los pesos costosos se leen una y otra vez para producir un token a la vez. Esa ineficiencia es por lo que usted paga un sobreprecio.

una pasada por token, estrictamente en orden

Esta es también la razón por la que los tokens de razonamiento se facturan como salida. El modelo los genera de la misma manera que genera una respuesta visible, una pasada secuencial a la vez, por lo que cuestan lo mismo incluso cuando la interfaz nunca se los muestra.

La entrada significa todo lo que el modelo ve

Los modelos no tienen estado. No recuerdan nada entre llamadas, por lo que cada turno vuelve a enviar toda la transcripción. El turno 20 paga por leer los turnos del 1 al 19 de nuevo. La entrada crece linealmente con el número de turno y el total acumulado crece de forma aproximadamente cuadrática, lo cual es la mayor sorpresa en la mayoría de las facturas.

$0.3018
total de la conversación
$0.00768
turno 1
$0.02250
turno final

La altura representa los tokens de entrada facturados en ese turno. La pendiente es el historial que sigue recomprando.

Los dos descuentos por los que vale la pena optimizar

10%

Caché de prompts

Cuando el inicio de su solicitud es idéntico a nivel de bytes a una reciente, el proveedor reutiliza el cálculo que ya realizó y factura ese prefijo a aproximadamente una décima parte de la tarifa de entrada. Las escrituras en caché tienen un pequeño recargo, alrededor de 1.25x, por lo que resulta rentable a partir de la segunda solicitud idéntica.

El inconveniente: solo funciona con un prefijo sin cambios. Coloque su system prompt y documentos al principio y manténgalos estables a nivel de bytes. Una marca de tiempo al inicio de su prompt destruye silenciosamente la caché en cada llamada.

50%

Procesamiento por lotes

Si acepta recibir los resultados en un plazo de 24 horas en lugar de inmediatamente, la mayoría de los proveedores reducen a la mitad las tarifas de entrada y salida. El modelo y el resultado son idénticos; solo está sacrificando latencia.

Útil para clasificación, enriquecimiento, resumen de tareas pendientes, evals y cualquier proceso nocturno. Inútil para cualquier cosa que requiera una respuesta inmediata para un humano.

Ejemplo práctico. Un intercambio de soporte con un prompt de 2,000 tokens donde 1,800 tokens son un system prompt en caché, más una respuesta de 150 tokens, en el nivel pequeño: la parte en caché cuesta una décima parte, los 200 tokens nuevos cuestan la tarifa completa y la respuesta es la única parte costosa. Eso es una fracción de centavo por conversación, que es exactamente la razón por la cual los bots de soporte de mensajes cortos son baratos de ejecutar y por la cual la misma arquitectura con una memoria de 20 turnos no lo es.

La misma oración cuesta más en su idioma

Una oración, el mismo significado, en 20 idiomas. Estos son conteos reales del tokenizer, calculados cuando se renderizó esta página, no estimaciones.

English · 8 palabras

The farmer inspected the maize field yesterday morning

The farmer inspected the maize field yesterday morning

8

tokens, aproximadamente uno por palabra

Swahili · 7 palabras

Mkulima alikagua shamba la mahindi jana asubuhi

Mkulima alikagua shamba la mahindi jana asubuhi

15

tokens, menos palabras pero cada una se fragmenta

Vocabulario
Idioma Palabras Tokens vs inglés  

Por qué sucede

Un vocabulario BPE se aprende encontrando las secuencias de caracteres más frecuentes en el corpus de entrenamiento, y ese corpus es mayoritariamente inglés. La palabra "yesterday" obtuvo un espacio dedicado por pura frecuencia. "asubuhi" nunca apareció lo suficiente, por lo que se reconstruye a partir de fragmentos genéricos cada vez que la envía.

El suajili se ve afectado doblemente. La subrepresentación es el factor dominante, y es mucho peor para escrituras no latinas. Además, el suajili es aglutinante: "alikagua" es a- (él o ella) más -li- (pasado) más -kagua (inspeccionar), tres palabras inglesas de significado soldadas en una sola forma superficial. Cada prefijo de sujeto multiplicado por el marcador de tiempo y la raíz del verbo es una palabra diferente, por lo que ningún vocabulario de cien mil entradas podría contenerlas todas.

Está mejorando, de forma desigual

Cambie el selector de vocabulario de arriba y observe cómo cambia la tabla. Los tokenizers más nuevos ampliaron su cobertura multilingüe, y para algunos idiomas la mejora es drástica, mientras que para otros apenas se nota.

Lo que esto le cuesta en la práctica. El mismo presupuesto compra menos oraciones, la ventana de contexto se llena aproximadamente el doble de rápido, los límites de salida llegan antes y, debido a que la generación es token por token, las respuestas se transmiten más lentamente. Tenga cuidado al generalizar a partir de una sola oración, incluida la anterior: medidos en una muestra más amplia, estos multiplicadores caen mucho, a aproximadamente 1.3x para el suajili y el bengalí y 1.25x para el hindi, mientras que el amárico se mantiene cerca de 5x. Presupueste a partir de su propio texto en lugar de una cifra general. Para mensajes de soporte cortos, el costo absoluto sigue siendo pequeño de cualquier manera; importa más para su presupuesto de contexto, no para sus márgenes.

Cuente tokens de su propio código

Esta página se ejecuta en un endpoint público que usted también puede llamar. No necesita API key, porque ejecuta un paso de tokenizer local y nunca toca un modelo.

curl https://dreamprompting.com/api/v1/tokenize \
  -H "Content-Type: application/json" \
  -d '{"text": "Mkulima alikagua shamba la mahindi jana asubuhi", "split": true}'
{
  "count": 15,
  "words": 7,
  "chars": 47,
  "exact": true,
  "encoding": "o200k_base",
  "heuristic_count": 12,
  "tokens": ["M", "kul", "ima", " al", "ik", "agua", ...]
}

Envíe una solicitud completa en lugar de una cadena pasando un array de mensajes con formato OpenAI, que cuenta cada rol de la forma en que el modelo lo leerá:

-d '{"messages": [{"role": "system", "content": "..."},
                 {"role": "user", "content": "..."}]}'

Una advertencia honesta: estos son vocabularios BPE de OpenAI. Llama, Gemini, Qwen y Mistral incluyen cada uno su propio tokenizer, así que trate el conteo como una estimación cercana para ellos en lugar de una cifra exacta. La relación relativa entre idiomas se mantiene en todos ellos. ¿Listo para gastar los tokens? Obtener una clave gratuita o lea la documentación de la API.

Qué es realmente un token

Un token no es una palabra, una sílaba o un carácter. Es una entrada en una tabla de búsqueda fija que se construyó una vez, antes del entrenamiento, fusionando repetidamente los pares de caracteres adyacentes más comunes en una pila gigante de texto hasta que la tabla alcanzó su tamaño objetivo. Eso es todo el byte pair encoding. La tabla queda congelada para siempre después de eso, por lo que la tokenización es determinista: los mismos bytes siempre producen los mismos tokens, en cada solicitud, durante la vida del modelo.

La consecuencia que a la gente le resulta más difícil de creer es que el espacio inicial es parte del token. El texto en inglés son mayoritariamente palabras precedidas por espacios, por lo que el proceso de fusión aprendió formas con prefijo de espacio y nunca se molestó en aprender muchas formas sin él. La palabra "unbelievable" con un espacio inicial es un token. Las mismas letras exactas sin espacio inicial son tres: "un", "bel", "ievable". Nada sobre el significado cambió. Solo la posición en la oración.

Cadena Tokens Cómo se divide
 unbelievable1unbelievable
unbelievable3un | bel | ievable
Hello1Hello
HELLO2HEL | LO
 tokenizer1tokenizer
 tokeniser2token | iser
café2c | afé
naïve3na | ï | ve
🙂1un emoji común obtuvo su propio espacio
👨‍👩‍👧‍👦11cuatro emojis más tres uniones, divididos en bytes

Cada conteo en esa tabla proviene del mismo tokenizer que usa el cuadro en la parte superior de esta página. Pegue cualquiera de ellos y observe la división. El patrón es consistente: lo que era frecuente en el corpus de entrenamiento es barato, lo que era raro se reconstruye a partir de fragmentos cada vez que lo envía. Gritar cuesta más que hablar. La ortografía británica a veces cuesta más que la estadounidense, aunque no siempre: "organisation" y "organization" son ambos un solo token, mientras que "tokeniser" cuesta el doble que "tokenizer". No hay ninguna regla aquí, solo frecuencia.

Esto también explica por qué la regla de cuatro caracteres por token no es fiable en ninguna de las dos direcciones. Medido en la prosa de esta sección, el inglés tiene alrededor de cinco caracteres por token, por lo que la regla sobreestima en aproximadamente una cuarta parte. Medido en amárico, no se acerca en absoluto: la misma oración que toma 8 tokens en inglés toma 55 en amárico, con apenas medio carácter por token.

Las cadenas que le cuestan más sin que se dé cuenta

La prosa es el caso para el que se optimizaron los tokenizers, y la prosa se comporta bien. Todo lo demás en un payload de aplicación real no lo hace. Los identificadores, marcas de tiempo, divisas, coordenadas y JSON con formato (pretty-printed) son secuencias que el proceso de fusión nunca vio lo suficiente como para comprimir, por lo que se desintegran en fragmentos casi a nivel de carácter. Estos son conteos reales, calculados con el mismo tokenizer:

Valor Caracteres Tokens
25531
100042
100000073
1,000,00095
$1,250.0096
2026-08-03106
+254712345678135
+1 (555) 123-45671710
a3f9c2b188
550e8400-e29b-41d4-a716-4466554400003618
https://dreamprompting.com/tools/tokens3910

El formato de serialización es una decisión de costes

El hábito más costoso en código LLM en producción es pasar JSON con formato (pretty-printed). Tome 200 filas de los mismos tres campos, un id numérico, un nombre y un booleano, y serialícelos de tres formas. JSON con formato: 5,500 tokens. JSON minificado: 3,100 tokens. CSV con una sola fila de encabezado: 1,432 tokens. Mismos datos, misma información, una reducción del 74 por ciento. Cada comilla, cada nombre de clave repetido y cada sangría es un token por el que usted pagó.

Formato para 200 registros Tokens Coste de entrada, nivel medio En 1,000 llamadas
JSON con formato (pretty-printed)5,500$0.0165$16.50
JSON minificado3,100$0.0093$9.30
CSV con una fila de encabezado1,432$0.0043$4.30

El código fuente se comporta mejor de lo que se podría suponer, porque el código estuvo fuertemente representado en el entrenamiento. Una función recursiva de Fibonacci de una línea son 23 tokens por 54 caracteres, y las secuencias de sangría se fusionan en tokens únicos en lugar de uno por espacio. La parte costosa de un prompt de código casi nunca es el código. Son los identificadores, los hashes, las rutas de archivo y los blobs JSON que envolvió a su alrededor.

La ventana de contexto que se anuncia y la que usted puede usar

La ventana de contexto es el número total de tokens que el modelo puede retener en una pasada hacia adelante (forward pass), y en casi todos los proveedores es un presupuesto compartido en lugar de una asignación de entrada. La entrada más la salida deben caber juntas dentro de ella. Una ventana de 128,000 tokens con una respuesta de 4,000 tokens le deja 124,000 tokens de prompt, no 128,000. Si también está ejecutando un modelo de razonamiento, los tokens de pensamiento ocultos salen del mismo presupuesto antes de que comience su respuesta visible, razón por la cual un prompt largo más un razonamiento profundo puede truncar una respuesta que se habría completado correctamente con un prompt más corto.

En prosa inglesa, medido en lugar de adivinado, 128,000 tokens son aproximadamente 106,000 palabras, lo cual es una novela de tamaño decente. Ese número depende del idioma exactamente de la manera que predice la tabla anterior. El mismo contenido en suajili llena la ventana unas 1.9 veces más rápido, y en amárico cerca de 7 veces más rápido. Una ventana es una promesa sobre tokens, nunca sobre significado.

Si la excede

La mayoría de las API rechazan la solicitud directamente con un error de longitud de contexto y no le cobran nada. Ese es el buen resultado. El mal resultado es una biblioteca cliente que trunca silenciosamente el medio de su transcripción, o elimina los turnos más antiguos, y devuelve una respuesta segura basada en un prompt que usted realmente no envió.

Mucho antes de que la exceda

La precisión se degrada mucho antes del límite anunciado. La recuperación de un hecho enterrado en medio de un prompt muy largo es notablemente peor que el mismo hecho cerca del principio o del final. Llenar la ventana solo porque puede es generalmente la opción más costosa y menos precisa disponible.

Lo que cuesta llenarla

Un documento de 100,000 tokens leído una vez cuesta $1.50 en el nivel frontier, $0.30 en el nivel medio, $0.08 en el nivel pequeño y $0.03 si se sirve desde un prompt cache. Releerlo en cada turno de una conversación de diez turnos multiplica cada uno de esos valores por diez.

La disciplina práctica es tratar la ventana como un presupuesto que usted asigna deliberadamente en lugar de un contenedor que llena. Decida de antemano cuántos tokens se destinan a instrucciones, cuántos a evidencia recuperada, cuántos al historial de conversación y cuántos reserva para la respuesta. Aplique esas asignaciones en el código con un conteo de tokens real, no una estimación de caracteres, porque la estimación de caracteres es lo que le hará excederse silenciosamente.

Lo que realmente reduce la factura, ordenado por cantidad

Todo lo siguiente se mide frente a un escenario base: una conversación de 20 turnos con un system prompt de 1,500 tokens, mensajes de usuario de 60 tokens y respuestas de 200 tokens, con precios del nivel medio. Esa base cuesta $0.3018. Cada palanca se aplica por separado para que los números sean comparables.

Palanca Nuevo coste Ahorro
Cambiar del nivel medio al nivel pequeño$0.080573%
Procesar por lotes y aceptar resultados en un plazo de 24 horas$0.150950%
Mantener solo los últimos 4 turnos del historial$0.208231%
Almacenar en caché el system prompt$0.220827%
Mantener solo los últimos 6 turnos del historial$0.230824%
Solicitar respuestas de 120 tokens en lugar de 200$0.232223%
Reducir el system prompt a la mitad, a 700 tokens$0.253816%
Nivel pequeño, prefijo en caché, ventana de 6 turnos, respuestas de 120 tokens$0.027291%

Dos cosas destacan. La primera es que la elección del modelo domina sobre todo lo demás por un amplio margen, y es la palanca que los equipos utilizan al final. La segunda es que nada en esta lista implica reescribir la prosa. Recortar frases de cortesía, eliminar los «por favor» y «gracias», o reducir espacios en blanco mueve la cifra en una fracción de porcentaje. Las secuencias de espacios ya se fusionan en tokens individuales, y un espacio inicial es absorbido por la palabra que le sigue. Los consejos para acortar prompts que circulan en línea optimizan el término más pequeño de la ecuación.

Una advertencia sobre la fila combinada: aplicar todas las palancas a la vez es la forma de lanzar un producto que es un 91 por ciento más barato y notablemente peor. Cambie una cosa, mida la calidad frente a un conjunto de evaluación fijo y luego cambie la siguiente. El orden anterior es un buen orden para probarlas precisamente porque los mayores ahorros se encuentran en la parte superior y el riesgo de calidad es más fácil de detectar allí.

Por qué un prompt largo se siente lento y una respuesta larga se siente más lenta

El tiempo de respuesta se divide en dos números que se comportan de forma completamente distinta, y confundirlos es la razón por la que gran parte de la optimización de latencia no lleva a ninguna parte. El Time to first token es cuánto tiempo esperas antes de que aparezca algo. Tokens per second es qué tan rápido llega el texto una vez que comienza. La longitud de entrada determina el primero. La longitud de salida determina el segundo. Son parámetros casi independientes.

Time to first token

Esta es la fase de prefill: una pasada paralela sobre todo el prompt para construir el caché de atención. Escala con la longitud del prompt, por lo que un prompt de 50,000 tokens tarda visiblemente más en comenzar que uno de 500 tokens, incluso en hardware idéntico. También es la fase que el prompt caching evita. Un acierto de caché omite la mayor parte del trabajo de prefill, razón por la cual el caché a menudo mejora la velocidad percibida más de lo que mejora la factura.

Tokens per second

Esta es la fase de decode, una pasada secuencial hacia adelante por token, y es casi constante independientemente de la longitud de su prompt. Lo que la cambia es el tamaño del modelo y qué tan ocupado esté el proveedor. Por lo tanto, la espera total para una respuesta larga está dominada por cuántos tokens solicitó, no por cuánto contexto proporcionó.

Esa división le da un diagnóstico claro. Si su aplicación se siente lenta antes de que aparezca algo, el problema es el tamaño del prompt: reduzca el contexto recuperado, almacene en caché el prefijo estable o recorte el historial. Si aparece rápidamente y luego se arrastra, el problema es la longitud de la respuesta: limite la salida, solicite respuestas estructuradas o concisas, o cambie a un modelo más pequeño y rápido. El streaming no hace que nada sea más rápido, solo adelanta el primer token visible, lo cual es una mejora real en la experiencia del usuario y no supone ningún ahorro en la factura.

La penalización multilingüe también afecta aquí, y esta es la parte para la que nadie presupuesta. Tokens per second es una tasa sobre tokens, no sobre significado. Si el suajili necesita 1.9 veces más tokens para decir lo mismo, la misma oración tarda 1.9 veces más en transmitirse a una cifra idéntica de tokens por segundo. Los usuarios que escriben en un idioma subrepresentado esperan más tiempo para obtener la misma respuesta, en el mismo hardware, a la misma velocidad anunciada.

Estimación de una factura mensual desde principios básicos

La mayoría de las sorpresas en los costos provienen de estimar con promedios en lugar de construir la cifra a partir de la forma de la solicitud. Aquí está la aritmética completa para un producto plausible: un asistente de soporte basado en recuperación. Cada cifra está calculada, no redondeada de memoria.

Las suposiciones

  • Un system prompt de 900 tokens con el tono, las políticas y las reglas de rechazo.
  • Tres fragmentos de documentación recuperados de unos 700 tokens cada uno, es decir, 2,100 tokens de evidencia.
  • Mensajes de usuario de unos 45 tokens, respuestas de unos 180 tokens.
  • Cuatro turnos en una conversación promedio, y 6,000 conversaciones al mes.

Trabaje primero con una conversación. El turno 1 factura 3,045 tokens de entrada: el system prompt de 900 tokens, 2,100 tokens de evidencia recuperada y la pregunta de 45 tokens. El turno 2 factura todo eso de nuevo más los 225 tokens que el turno 1 añadió a la transcripción. Para el turno 4, la entrada ha crecido a 3,720 tokens. A lo largo de los cuatro turnos, la conversación factura 13,530 tokens de entrada y 720 tokens de salida, lo que en el nivel medio cuesta $0.0514. Multiplique por 6,000 conversaciones y la factura mensual es de $308.34.

Ahora aplique las palancas y observe cuáles importan realmente en esta configuración. Almacenar en caché solo el system prompt ahorra un 19 por ciento, porque el system prompt es una pequeña fracción del total. Almacenar en caché el system prompt y los fragmentos recuperados juntos, lo que requiere poner la recuperación antes de la pregunta y mantener estable el orden de los fragmentos, ahorra un 63 por ciento y reduce la factura a $113.94. Recortar las respuestas de 180 a 110 tokens ahorra alrededor de un 11 por ciento. Recuperar un fragmento en lugar de tres ahorra un 33 por ciento. Ejecutar el mismo diseño en el nivel pequeño cuesta $82.22, y en el nivel pequeño con un prefijo en caché, $30.38. En el nivel frontier, el mismo producto cuesta $1,541.70.

Configuración Por conversación 6,000 al mes
Nivel frontier, nada optimizado$0.2570$1,541.70
Nivel medio, nada optimizado$0.0514$308.34
Nivel medio, system prompt en caché$0.0417$250.02
Nivel medio, un fragmento recuperado en lugar de tres$0.0346$207.54
Nivel medio, prefijo completo en caché$0.0190$113.94
Nivel pequeño, prefijo completo en caché$0.0051$30.38

La diferencia entre el valor más alto y el más bajo de esa tabla es un factor de 50, en el mismo producto, atendiendo a los mismos usuarios y respondiendo a las mismas preguntas. Esa es la verdadera lección de la facturación por token: la factura es un resultado de diseño, no un precio de mercado que se le impone.

Dos ajustes antes de confiar en una estimación como esta. Multiplique por aproximadamente 2 si una parte significativa de su tráfico está en un idioma subrepresentado, ya que cada recuento de tokens de entrada y salida anterior escala con la tasa de fragmentación. Y añada un margen de maniobra para las conversaciones largas: los promedios ocultan los casos extremos y, dado que el costo crece de forma cuadrática con el número de turnos, el 5 por ciento de las conversaciones que llegan a 20 turnos puede representar fácilmente un tercio de la factura.

Cada familia de modelos cuenta de forma diferente

No existe un token universal. Un tokenizer se entrena junto con una familia de modelos, sobre el corpus de esa familia, con el tamaño de vocabulario que el equipo haya elegido, y se distribuye congelado junto con los pesos. Dos modelos pueden leer la misma cadena y facturarle un número diferente de tokens. Los dos vocabularios en esta página lo hacen concreto: las mismas doce sentencias son contadas por ambos, y cambiar el selector de arriba mueve varias filas drásticamente.

El hindi es el caso más claro. En el vocabulario antiguo de 100k, la frase de muestra cuesta 42 tokens. En el nuevo vocabulario de 200k, la misma frase cuesta 15. Eso es un recorte de precio del 64 por ciento logrado solo mediante una tabla de búsqueda más grande. El árabe baja de 21 a 11. El amárico cae de 74 a 55, lo cual es una mejora real, aunque sigue costando casi siete veces más que el inglés. El inglés en sí no cambia en absoluto, porque nunca fue el idioma que pagaba el recargo.

Las consecuencias prácticas merecen ser tomadas en serio si se enruta a través de proveedores. Un prompt diseñado para encajar exactamente dentro de una ventana de contexto en un modelo puede desbordarse en otro. Un modelo de costos calibrado para una familia calculará mal el precio de otra, en cualquier dirección. Los límites de tasa expresados en tokens por minuto no son comparables entre proveedores. Además, una caché de prompt está vinculada a un proveedor y a un prefijo exacto, por lo que cambiar de modelo la descarta silenciosamente y sus costos vuelven a la tarifa completa sin ningún error que le indique por qué.

El hábito seguro es contar con el tokenizer que pertenece al modelo que realmente está llamando, mantener un pequeño margen en lugar de llenar la ventana hasta el último token y tratar cualquier número entre familias como una estimación. Los recuentos en esta página utilizan vocabularios BPE de OpenAI. Para Llama, Gemini, Qwen o Mistral serán cercanos pero no exactos. Lo que sí se transfiere entre todas las familias es la forma del problema: la prosa es barata, los identificadores son caros y los idiomas subrepresentados pagan un multiplicador.

El recargo multilingüe no es principalmente un problema de costos

El dinero extra es la parte más fácil de ver y la menos importante. Para mensajes de soporte cortos, la diferencia absoluta es de fracciones de centavo. Otros tres efectos son más perjudiciales y ninguno de ellos aparece en una factura.

La mitad de la memoria

Una ventana de contexto fija contiene aproximadamente la mitad de conversación en suajili que en inglés, y alrededor de una séptima parte en amárico. Cualquier regla de recorte de historial que haya escrito mientras probaba en inglés descartará mucha más conversación para esos usuarios, por lo que el asistente olvida antes y responde peor.

Respuestas cortadas

Los límites de salida se establecen en tokens. Un límite de 500 tokens que se ajusta cómodamente a una respuesta completa en inglés trunca la misma respuesta a mitad de frase en un idioma fragmentado. El modelo no es menos útil; su límite está midiendo algo incorrecto.

Respuestas más lentas

La generación es una pasada hacia adelante por token. Más tokens para la misma frase significan una espera más larga, por lo que el producto simplemente se siente más lento en estos idiomas, mientras que todos los paneles de control reportan tokens por segundo idénticos.

Existe una dimensión de calidad subyacente a los tres puntos. Una palabra dividida en seis fragmentos genéricos transmite menos significado coherente al modelo que una palabra con su propia entrada dedicada, por lo que los idiomas muy fragmentados tienden a obtener resultados más débiles además de ser más caros. El tokenizer es la primera capa del modelo y se ajustó a un corpus que, en su mayor parte, no trataba sobre usted.

Si está desarrollando para estos usuarios, las mitigaciones son poco glamorosas pero efectivas: presupueste el contexto en tokens medidos sobre texto de muestra real en el idioma de destino en lugar de en inglés, establezca límites de salida por idioma en lugar de globalmente, pruebe las reglas de recorte de historial en transcripciones que no estén en inglés y prefiera vocabularios más nuevos cuando tenga la opción. La fila de hindi en esta página representa un ahorro del 64 por ciento disponible de forma gratuita para cualquiera que verifique qué tokenizer está utilizando.

Preguntas que la gente realmente hace

¿Es útil la regla de cuatro caracteres por token?
Solo para prosa en inglés, e incluso así es imprecisa. Sobreestima las frases cortas en inglés y subestima gravemente los alfabetos no latinos. Utilice la tokenización en lugar de estimar siempre que el número sea importante.
¿Pago por el system prompt en cada turno?
Sí, a menos que esté en caché. Se vuelve a enviar con cada solicitud porque el modelo no mantiene estado entre llamadas. Un system prompt estable es el mejor candidato para caché que tiene.
¿Pago por los tokens de razonamiento que nunca veo?
Sí, y se facturan a la tarifa de salida, porque el modelo los genera exactamente de la misma manera que genera el texto visible.
¿Recortar espacios en blanco o puntuación ahorra dinero?
Apenas. Los espacios iniciales suelen absorberse en el siguiente token. Recortar el historial de conversación, almacenar en caché un prefijo estable y pedir respuestas más cortas valen órdenes de magnitud más.
¿Puedo evitar todo esto?
Puede trasladar la factura en lugar de eliminarla. Ejecutar un modelo de pesos abiertos en su propia GPU intercambia el costo por token por hardware que debe comprar y mantener ocupado. El Calculadora de VRAM muestra qué hardware se necesita. O puede enrutar a través de esta pasarela, que agrupa los niveles gratuitos de los proveedores y no tiene costo.
¿Por qué una palabra cuesta más cuando empieza una frase?
Porque el espacio inicial es parte del token. El tokenizer aprendió formas con prefijo de espacio a partir de prosa ordinaria, por lo que la palabra unbelievable con un espacio delante es un solo token, mientras que las mismas letras sin nada delante se dividen en tres. Las mayúsculas tienen el mismo efecto por una razón diferente: Hello es un token y HELLO son dos, ya que gritar es menos frecuente en los datos de entrenamiento que el uso normal.
¿Son realmente tan caros los números?
Sí, y el formato lo empeora. Los dígitos se agrupan en series de hasta tres, por lo que 255 es un token pero 1000 son dos. Añadir separadores factura cada separador: 1000000 son tres tokens mientras que 1,000,000 son cinco, y $1,250.00 son seis. Una fecha ISO como 2026-08-03 cuesta seis tokens, en cada fila de cada tabla que pegue.
¿Qué tan caro es un UUID?
Un UUID estándar de 36 caracteres son 18 tokens, más que una frase completa en inglés. Los hashes hexadecimales cortos son peores por carácter: a3f9c2b1 resulta en exactamente un token por carácter. Si está pasando identificadores a un prompt a gran escala, reemplazarlos con etiquetas secuenciales cortas y mapearlos después es una de las pocas victorias genuinamente grandes para reducir el prompt.
¿Debo enviar JSON o CSV al modelo?
CSV, siempre que los datos sean tabulares. Doscientas filas de tres campos cuestan 5,500 tokens como JSON con formato, 3,100 minificado y 1,432 como CSV con una sola fila de encabezado. Eso es una reducción del 74 por ciento para información idéntica, porque JSON repite cada nombre de clave en cada registro y paga por cada comilla y cada espacio de sangría.
¿La ventana de contexto incluye la respuesta?
En prácticamente todos los proveedores, sí. La entrada y la salida comparten un mismo presupuesto, por lo que una ventana de 128,000 tokens con una respuesta de 4,000 tokens le deja 124,000 tokens para el prompt. Los tokens de razonamiento salen del mismo grupo antes de que comience la respuesta visible, que es como un prompt largo en un modelo de razonamiento puede truncar una respuesta que se habría completado bien en uno más corto.
¿Qué sucede si supero la ventana de contexto?
Una API bien diseñada rechaza la solicitud con un error de longitud de contexto y no realiza cargos. El caso peligroso es una librería cliente que trunca silenciosamente el medio de la transcripción o elimina los turnos más antiguos y devuelve una respuesta segura basada en un prompt que nunca envió. Cuente los tokens antes de enviar en lugar de descubrirlo después.
¿Cuántas palabras caben en una ventana de contexto de 128k?
Alrededor de 106,000 palabras de prosa en inglés, medidas sobre texto real y no estimado. Esa cifra depende del idioma, al igual que todo lo demás: el mismo contenido en suajili llena la ventana unas 1.9 veces más rápido y en amárico cerca de 7 veces más rápido.
¿El streaming hace que las respuestas sean más baratas o rápidas?
Ninguna de las dos. El streaming muestra el primer token antes, lo cual es una mejora real en la experiencia de usuario, pero el tiempo total de generación y el conteo total de tokens no cambian. Cuesta exactamente lo mismo que la solicitud idéntica sin streaming.
¿Un prompt más largo hace que la generación sea más lenta?
Hace que la espera antes del primer token sea mayor, porque el prefill escala con la longitud del prompt. Apenas afecta la velocidad a la que llega el texto después, la cual está determinada por el tamaño del modelo y la carga del proveedor. Por lo tanto, si su aplicación es lenta antes de que aparezca algo, reduzca el prompt. Si aparece rápido y luego se ralentiza, limite la salida.
¿Cuál es el factor que más influye en el costo?
La elección del modelo, por un amplio margen, y suele ser lo último que prueban los equipos. En la línea base de 20 turnos utilizada en esta página, pasar del nivel medio al nivel pequeño reduce el costo en un 73 por ciento. El batching reduce un 50 por ciento, una ventana de historial de 4 turnos un 31 por ciento y el almacenamiento en caché del system prompt un 27 por ciento. Reescribir su prompt para que sea más conciso representa una fracción de un por ciento.
¿Diferentes modelos cuentan el mismo texto como el mismo número de tokens?
No. Cada familia incluye su propio tokenizer, congelado con los pesos. Incluso entre dos vocabularios del mismo proveedor la diferencia es grande: la muestra en hindi en esta página cuesta 42 tokens en el vocabulario antiguo de 100k y 15 en el nuevo de 200k. Cuente con el tokenizer que pertenece al modelo que está llamando realmente y deje margen en lugar de llenar la ventana exactamente.
¿Por qué dejó de funcionar mi caché de prompt?
Casi siempre porque el prefijo dejó de ser idéntico a nivel de bytes. Una marca de tiempo, un id de sesión, un saludo aleatorio, un conjunto reordenado de fragmentos recuperados o un cambio de modelo lo invalidan, y ninguno de ellos genera un error. Ponga todo lo estable primero, manténgalo estable y coloque las partes variables al final.
¿Puedo corregir la penalización multilingüe en mi propio código?
No puede cambiar el tokenizer, pero puede evitar que sus propios límites lo agraven. Presupueste el contexto usando conteos de tokens medidos en texto de muestra real en el idioma objetivo, establezca límites de salida por idioma en lugar de un número global, pruebe su regla de recorte de historial en transcripciones que no estén en inglés y elija el vocabulario más nuevo cuando tenga esa opción. Traducir al inglés, llamar al modelo y luego traducir de vuelta es ocasionalmente más barato, pero suele perder más en calidad de lo que ahorra.
¿Vale la pena contar los tokens antes de cada solicitud?
Para cualquier cosa orientada al usuario, sí. Tokenizar localmente no requiere API key ni llamada de red, y es la única forma fiable de aplicar un presupuesto de contexto, rechazar subidas demasiado grandes con antelación y mostrar una estimación de costo real en lugar de una suposición basada en caracteres. El endpoint documentado arriba hace exactamente eso y su llamada es gratuita.