Skip to main content

Command Palette

Search for a command to run...

Fundamentos de IA

Tokens e preços

Agora que entendemos, em linhas gerais, como os modelos de IA funcionam, vamos entrar em algo que ajuda a entender tanto como esses modelos “pensam” quanto quanto custa usá-los: tokens.

Você pode pensar nos tokens como as “palavras” que os modelos de IA realmente entendem. Mas não é bem assim: eles não são exatamente as mesmas palavras que você e eu usamos.

Assim como o seu computador não entende de fato a letra “A”, mas trabalha com código binário (1 e 0), os modelos de IA também não operam diretamente com palavras como “hello” ou “world”. Em vez disso, eles quebram tudo em partes menores chamadas tokens.

Por exemplo, a palavra “hello” pode ser um token, mas “understanding” pode ser dividida em vários tokens como “under”, “stand” e “ing”. Às vezes, até partes de palavras, pontuação ou espaços viram tokens próprios.

Por que isso importa? Dois motivos:

  1. Tokens determinam o preço dos modelos. Você paga por token, não por palavra ou caractere.
  2. Tokens medem a velocidade do modelo. Modelos mais rápidos têm TPS mais alto (tokens por segundo), que são retornados ao usuário.

Vamos falar de preços primeiro, já que isso impacta quanto você gasta ao usar modelos de IA.

Entendendo tokens

Se seguirmos a analogia de que modelos de IA são como APIs, então tokens são as unidades usadas para medir e cobrar pelo tráfego de entrada e saída.

Modelos de IA cobram com base em dois tipos de tokens:

  1. Tokens de entrada, que incluem tudo o que você envia ao modelo, como seu prompt e a conversa anterior.
  2. Tokens de saída, que incluem tudo o que o modelo gera de volta para você.

Tokens de saída geralmente custam de 2 a 4 vezes mais do que tokens de entrada, porque gerar novo conteúdo exige mais trabalho computacional do que apenas processar o que você enviou.

Como os modelos de IA cobram com base em tokens, entendê-los é essencial para gerenciar seus custos. Pense nisso como entender os custos do seu servidor.

Você vai querer ser intencional quanto à quantidade de informação incluída no contexto inicial — que abordaremos a seguir — e quanto a como orientar o modelo para ser conciso ou detalhado em suas respostas.

Transmissão de respostas

Você já reparou como o ChatGPT ou outros chatbots de IA parecem “digitar” as respostas em tempo real? Não é só um efeito visual — é realmente como os modelos funcionam por baixo dos panos.

Modelos de IA geram tokens um de cada vez, em sequência. Eles preveem o próximo token e usam essa previsão para ajudar a prever o seguinte, e assim por diante. É por isso que você vê as respostas surgirem palavra por palavra (ou melhor, token por token).

As respostas podem então ser transmitidas de volta para você. Isso é ótimo porque você não precisa esperar a resposta completa, o que pode levar minutos, e pode interromper o modelo se ele começar a sair do rumo.

Qual afirmação sobre transmissão é correta?

Otimizando o uso de tokens

Ferramentas de IA frequentemente usam técnicas para reduzir o número de tokens enviados aos modelos subjacentes. Por exemplo, armazenar automaticamente em cache partes do seu prompt que você usa repetidamente ou ajudar você a gerenciar o contexto incluído em cada solicitação.

Vamos nos aprofundar no contexto na próxima lição.

Você concluiu este capítulo