Tokens y precios
Ahora que entendemos cómo funcionan los modelos de IA a alto nivel, profundicemos en algo que te ayudará a comprender tanto cómo piensan estos modelos como cuánto cuesta usarlos: los tokens.
Puedes pensar en los tokens como las “palabras” que los modelos de IA realmente entienden. Pero ojo: no son exactamente lo mismo que las palabras que tú y yo usaríamos.
Así como tu computadora no entiende realmente la letra “A”, sino que trabaja con código binario (1 y 0), los modelos de IA tampoco trabajan directamente con palabras como “hello” o “world”. En su lugar, descomponen todo en fragmentos más pequeños llamados tokens.
Por ejemplo, la palabra “hello” podría ser un token, pero la palabra “understanding” podría dividirse en varios tokens como “under”, “stand” e “ing”. A veces, incluso partes de palabras, signos de puntuación o espacios se convierten en tokens propios.
Entonces, ¿por qué importa esto? Por dos razones:
- Los tokens determinan el precio de los modelos. Pagas por token, no por palabra ni por carácter.
- Los tokens son cómo medimos la velocidad del modelo. Los modelos más rápidos tienen mayor TPS (tokens por segundo), que se devuelven al usuario.
Hablemos primero de los precios, ya que esto afecta cuánto gastas en el uso de modelos de IA.
Comprender los tokens
Si seguimos con la analogía de que los modelos de IA son como APIs, entonces los tokens son las unidades que usamos para medir y cobrar el tráfico de entrada y salida.
Los modelos de IA cobran según dos tipos de tokens:
- Tokens de entrada, que incluyen todo lo que envías al modelo, como tu prompt y la conversación previa.
- Tokens de salida, que incluyen todo lo que el modelo genera para ti.
Los tokens de salida suelen costar entre 2 y 4 veces más que los tokens de entrada, porque generar contenido nuevo requiere más trabajo computacional que solo procesar lo que enviaste.
Dado que los modelos de IA cobran en función de tokens, comprenderlos es clave para gestionar tus costos. Piénsalo como conocer los costos de tu servidor.
Querrás ser deliberado respecto de cuánta información incluyes en tu contexto inicial —de lo que hablaremos a continuación— y cómo orientas al modelo para que sea conciso o detallado en sus respuestas.
Respuestas en streaming
¿Has notado cómo ChatGPT u otros chatbots de IA parecen “escribir” sus respuestas en tiempo real? No es solo un efecto visual; así es como funcionan los modelos internamente.
Los modelos de IA generan tokens uno a la vez, en secuencia. Predicen el siguiente token, luego usan esa predicción para ayudar a predecir el siguiente, y así sucesivamente. Por eso ves que las respuestas aparecen palabra por palabra (o más bien, token por token).
Las respuestas pueden transmitirse a medida que se generan. Esto es ideal porque no tienes que esperar a que termine toda la respuesta, lo cual podría tomar minutos, y puedes interrumpir al modelo si empieza a desviarse.
¿Cuál afirmación sobre el streaming es correcta?
Optimización del uso de tokens
Las herramientas de IA suelen emplear técnicas para reducir la cantidad de tokens que se envían a los modelos subyacentes. Por ejemplo, almacenar en caché automáticamente partes de tu prompt que usas con frecuencia o ayudarte a gestionar el contexto que incluyes en cada solicitud.
Profundicemos en el contexto en la próxima lección.