AIエージェントの利用では、気付かないうちにコストが膨らむ「トークンの浪費」が起こりがちです。どうすればAIエージェントが消費するトークンを適正に抑制できるのでしょうか。5つの視点で考えます。
この記事は会員限定です。会員登録(無料)すると全てご覧いただけます。
AIエージェントは、通常のチャットと比べて多くのトークンを消費する傾向があります。Anthropicの研究では、エージェント型のワークフローは通常のチャットのおよそ4倍、複数のエージェントが連携する構成では約15倍のトークンを消費すると報告されています。
その背景として、AIエージェント特有の処理の仕組みを第3回で解説しました。1つのタスクをこなすためにモデルやツールを何度も呼び出し、そのたびにシステムプロンプトや会話履歴などの文脈を読み込む――。こうした処理の積み重ねが、トークン消費を膨らませる一因になります。
大規模言語モデル(LLM)のトークン単価は下がり、同じ処理にかかる費用はどんどん安くなってきました。しかし単価の下落を上回るペースでトークンの消費量が増えれば、企業が支払うAIの請求額はむしろ膨らむ事態は避けられません。では、「トークンの浪費」をどう抑えればいいのでしょうか。
どこで浪費が起きているかが見えれば、対処できます。主な打ち手を、5つの観点で効果の大きい順に整理します。
1つ目は、プロンプトキャッシュです。システムプロンプトやツール定義、参照文書のように毎回変わらない前置きを、その都度作り直さず再利用します。Anthropicの場合、キャッシュから読み出したトークンの料金は、通常の入力の10分の1、つまり9割の削減です。OpenAIも、特別な設定なしにキャッシュを自動で効かせ、料金をおよそ半分に抑えます。
さらに、意味の近い問い合わせに過去の応答を再利用するセマンティックキャッシュという層もあります。LLMへのリクエストのおよそ3割が、過去のものと意味的に似ているという調査もあり、うまく使えば無視できない削減になります。
2つ目は、モデルルーティングです。全てのリクエストを最上位のモデルに送るのをやめ、簡単なものは小型のモデルへ回します。RouteLLMの研究では、フロンティアモデルへの送信を全体の約4分の1に抑えながら、その品質の約95%を保ち、最大で85%のコストを削れたと報告されています。ただしこれはベンチマーク条件下の数字で、実際にどれだけ削れるかはワークロード次第です。この数字をそのまま当てにはできず、現実には想定の3分の1ほど削れれば十分、という見立てが無難でしょう。それでも、全てを最上位モデルに投げ続けるよりは、はるかに安く済みます。
3つ目は、コンテキストの圧縮です。MicrosoftのLLMLinguaのように、意味を保ったまま情報量の低いトークンを削る手法が研究され、実装も進んでいます。
4つ目は、バッチ処理です。即時の応答が要らない処理はまとめて送れば、多くのサービスで料金が半分になります。たとえば5万件の文書処理で、キャッシュなしでは月に約4万5000ドルかかっていたものが、プロンプトキャッシュとバッチを組み合わせて月2300ドル未満まで下がった、という報告もあります。同じ処理で、支払いが20分の1近くになった計算です。
5つ目が、第3回でも触れたツールの絞り込みです。AIエージェントに大量のツールを与えると、そのツール名や機能、引数などの定義をコンテキストに含める必要があり、それだけでトークンを消費します。そこで、既存APIのエンドポイントをそのまま全てツールとして公開するのではなく、「顧客を照会する」「注文を確定する」といったエージェントが実行するタスクの単位にまとめ、必要なツールだけを公開します。
5つの対策の要点をまとめると下表の通りです。
| 対策 | 削減の目安 | 前提・注意 |
|---|---|---|
| プロンプトキャッシュ | キャッシュ読み取りの料金が約9割減 | 同じ前置きを繰り返す処理で効く |
| モデルルーティング | 最大85%(GPT-4品質の約95%維持) | ベンチマーク値。実際はワークロード次第 |
| コンテキスト圧縮 | 冗長なトークンを削減 | 情報の欠落に注意(例:LLMLingua) |
| バッチ処理 | 多くのサービスで料金が半分に | 即時の応答が要らない処理向け |
| ツールの絞り込み | プロンプトトークンが半分以下・選択精度3倍 | 公開するツールを意図の単位に限定 |
ただし、注意も要ります。これらは、組み合わせるほど効果が増す一方で、品質を少しずつ損なうリスクもあります。とくにルーティングによる劣化は、エラーを出さずに進むため気付きにくい。安く速くなったつもりが、答えの質が落ちていた、という事態は避けなければなりません。だからこそ、最後に欠かせない一点があります。
ここまでの打ち手には、共通の前提があります。どこで、いくら使っているかが見えていることです。ところが多くの現場では、そもそもトークンが、どのタスクで、どのツールを、何回呼んで消費されているのかを、把握できていません。見えないコストは、減らしようがありません。第2回で触れた監査の話と、根は同じです。何が起きているかを記録できていなければ、コストもセキュリティも、後から手の打ちようがありません。
非決定的に動くエージェントのAPI消費は、どのタスクが・どのツールを・何回呼び・いくらかかったか、という単位で、APIのモニタリングと同じ発想で計測できます。どのチームの、どのエージェントが、どれだけ使っているかを切り分けられれば、費用を成果に結び付けて語れるようになり、削るべき無駄と、投じる価値のある消費とを見分けられます。計測する仕組みがあって初めて、キャッシュもルーティングも絞り込みも、効果を確かめながら回せるようになります。クラウド費用を可視化して最適化してきたFinOpsの手法を、そのままトークン消費に持ち込む動きも広がっています。
従って、ここでも問いは同じ形になります。いくら使い、それに見合う成果が出ているか。この問いに即答できないなら、予算を制御できているとは言えません。トークンの浪費は、単価が安くなるほど見えにくくなり、そしてじわじわと積み上がっていくのです。
次回は、いよいよ実装の層へ降ります。2026年7月28日に正式化されたMCPの最新仕様によって、MCPサーバは、ごく普通のHTTPの部品へと変わりました。そしてその世界では、APIを呼ぶのは、もう人間ではありません。
「APIキーは.envに」はもはや通用しない AIエージェントの“内通者化”をどう防ぐ?
「AIトークンコスト増を44%抑制」できる可能性も 高性能モデルの“使い過ぎ”、どう減らす?
「トークン単価50%減でもAI請求額が跳ね上がる」なぜ? Uberは4月で年間予算が枯渇Copyright © ITmedia, Inc. All Rights Reserved.