トークンと料金
AIモデルの仕組みを大まかに理解したところで、次はモデルがどう「考える」かと利用にいくらかかるかの両方を理解するのに役立つ「トークン」について見ていきましょう。
トークンは、AIモデルが実際に扱う「言葉」のようなものです。ただし、私たちが使う単語とまったく同じではありません。
コンピュータが文字「A」を理解しているのではなく、実際には2進数 (1と0) で処理しているのと同様に、AIモデルも「hello」や「world」のような単語を直接扱うのではなく、すべてをトークンと呼ばれる小さな単位に分解します。
例えば「hello」は1トークンかもしれませんが、「understanding」は「under」「stand」「ing」のように複数のトークンに分割される場合があります。単語の一部や句読点、スペースが、それ自体でトークンになることもあります。
これが重要な理由は2つあります。
- 料金はトークンで決まります。 支払いは単語や文字ではなくトークン単位です。
- 速度の指標もトークンです。 高速なモデルはTPS (tokens per second、毎秒トークン数) が高く、結果がより速く返ってきます。
まずは料金について説明します。これはAIモデルの利用コストに直結します。
トークンを理解する
AIモデルをAPIにたとえるなら、トークンは入出力のトラフィックを測り、課金するための単位です。
AIモデルの課金は次の2種類のトークンに基づきます。
- 入力トークン: プロンプトやこれまでの会話など、モデルに送るすべて。
- 出力トークン: モデルが返してくる生成結果のすべて。
出力トークンは通常、入力トークンの2〜4倍のコストがかかります。新しい内容を生成するほうが、送られた情報を処理するだけより計算量が多いためです。
AIモデルはトークンベースで課金されるため、トークンの仕組みを理解することがコスト管理の鍵です。サーバーコストの把握に近いイメージです。
初期コンテキストに含める情報量や、応答を簡潔にするか詳細にするかといったモデルの誘導は、意図を持って設計しましょう。次で説明します。
ストリーミング応答
ChatGPT などの AI チャットボットが、その場で文字を「タイプ」しているように見えることはありませんか?あれは単なる視覚効果ではなく、実際にモデルがそのように動作しているのです。
AI モデルはトークンを一つずつ、順番に生成します。次のトークンを予測し、その結果を使ってさらに次のトークンを予測していきます。だからこそ、 (正確にはトークン単位ですが) 単語ごとに応答が現れるのです。
応答はそのままストリーミングされます。これにより、全体の応答が終わるまで待つ必要がなく (数分かかることもあります) 、モデルが逸れてきたら中断することもできます。
ストリーミングに関して正しい記述はどれですか?
トークン使用の最適化
AI ツールは、基盤モデルに送るトークン数を減らすための手法をよく用います。たとえば、繰り返し使うプロンプトの一部を自動でキャッシュしたり、各リクエストに含めるコンテキストの管理を支援したりします。
次のレッスンでは、コンテキストをさらに深掘りします。