Skip to main content

Command Palette

Search for a command to run...

AI の基礎

トークンと料金

AIモデルの仕組みを大まかに理解したところで、次はモデルがどう「考える」かと利用にいくらかかるかの両方を理解するのに役立つ「トークン」について見ていきましょう。

トークンは、AIモデルが実際に扱う「言葉」のようなものです。ただし、私たちが使う単語とまったく同じではありません。

コンピュータが文字「A」を理解しているのではなく、実際には2進数 (1と0) で処理しているのと同様に、AIモデルも「hello」や「world」のような単語を直接扱うのではなく、すべてをトークンと呼ばれる小さな単位に分解します。

例えば「hello」は1トークンかもしれませんが、「understanding」は「under」「stand」「ing」のように複数のトークンに分割される場合があります。単語の一部や句読点、スペースが、それ自体でトークンになることもあります。

これが重要な理由は2つあります。

  1. 料金はトークンで決まります。 支払いは単語や文字ではなくトークン単位です。
  2. 速度の指標もトークンです。 高速なモデルはTPS (tokens per second、毎秒トークン数) が高く、結果がより速く返ってきます。

まずは料金について説明します。これはAIモデルの利用コストに直結します。

トークンを理解する

AIモデルをAPIにたとえるなら、トークンは入出力のトラフィックを測り、課金するための単位です。

AIモデルの課金は次の2種類のトークンに基づきます。

  1. 入力トークン: プロンプトやこれまでの会話など、モデルに送るすべて。
  2. 出力トークン: モデルが返してくる生成結果のすべて。

出力トークンは通常、入力トークンの2〜4倍のコストがかかります。新しい内容を生成するほうが、送られた情報を処理するだけより計算量が多いためです。

AIモデルはトークンベースで課金されるため、トークンの仕組みを理解することがコスト管理の鍵です。サーバーコストの把握に近いイメージです。

初期コンテキストに含める情報量や、応答を簡潔にするか詳細にするかといったモデルの誘導は、意図を持って設計しましょう。次で説明します。

ストリーミング応答

ChatGPT などの AI チャットボットが、その場で文字を「タイプ」しているように見えることはありませんか?あれは単なる視覚効果ではなく、実際にモデルがそのように動作しているのです。

AI モデルはトークンを一つずつ、順番に生成します。次のトークンを予測し、その結果を使ってさらに次のトークンを予測していきます。だからこそ、 (正確にはトークン単位ですが) 単語ごとに応答が現れるのです。

応答はそのままストリーミングされます。これにより、全体の応答が終わるまで待つ必要がなく (数分かかることもあります) 、モデルが逸れてきたら中断することもできます。

ストリーミングに関して正しい記述はどれですか?

トークン使用の最適化

AI ツールは、基盤モデルに送るトークン数を減らすための手法をよく用います。たとえば、繰り返し使うプロンプトの一部を自動でキャッシュしたり、各リクエストに含めるコンテキストの管理を支援したりします。

次のレッスンでは、コンテキストをさらに深掘りします。

この章は完了しました