文章を1トークン生成するたびに読み出すKVキャッシュを、中国の開発会社ディープシークが2年10か月で最初の版の0.23%まで減らした。この小ささが中国AIの価格を押し下げ、オープンルーターでは利用量の7割超を中国勢が占める。
米国の大手クラウド事業者は、2026年に中国勢の約7倍の設備投資を計画している。計算資源の量で追いつけない中国の開発各社は、推論の効率で差を詰めにいった。その代表例が、中国の人工知能 (AI) 開発会社ディープシークの最新モデル V4.1-Flash で、1トークンあたりの KVキャッシュを最初の版の437分の1にまで減らした。効率の差は価格に表れている。AIモデルの利用を仲介するオープンルーターでは、中国製モデルが利用量の7〜8割を占める一方、支払われた金額では2〜4割にとどまる。利用量と支出の割合が大きく食い違うこと自体が、中国製モデルの単価の低さを示している。
米国の設備投資は2026年に中国の約7倍、中国AIは推論の効率で差を詰める
ゴールドマン・サックスの推計では、米国の主要クラウド事業者5社 (アマゾン・ウェブ・サービス、マイクロソフト、グーグル、メタ、オラクル) の設備投資は、2022年と2023年の1,560億ドルから2024年に2,540億ドル、2025年に4,430億ドルへ増えた。予測では2026年が8,060億ドル、2027年が1兆2,340億ドルになる。中国の4社 (アリババ、テンセント、バイトダンス、バイドゥ) は2022年の80億ドル、2023年の180億ドル、2024年の360億ドル、2025年の570億ドルから、2026年に1,160億ドル、2027年に1,410億ドルとなる予測だ。バイトダンスは同社の調査対象外のため、業界と調査対象企業の分析から推計した数字を当てはめている。2026年の予測では米国が中国の6.9倍、2027年の予測では8.8倍にあたり、計算資源の量の差は開いたままとなる。
同社は投資負担の目安として、設備投資を営業キャッシュフローで割った比率も示した。米国5社は2025年の73%から、2026年予測で102%、2027年予測で115%、2028年予測で102%と、稼いだ現金を上回る投資が続く。中国3社 (アリババ、テンセント、バイドゥ) は2025年の68%から2026年予測の100%で頂点に達し、2027年予測で86%、2028年予測で73%へ下がる見通しで、同社は中国勢の比率を「なお健全」と評した。過去の比率は、2022年が米国54%・中国15%、2023年が41%・14%、2024年が53%・36%だった。投資額の比較の詳しい分析は 米中の計算資源の差を分解した記事 にまとめている。
KVキャッシュは生成のたびに読み出すデータで、ディープシークは3つの方法と精度の引き下げで437分の1にした
大規模言語モデルは文章を1トークンずつ生成する。次のトークンを生成するとき、それまでのすべてのトークンについて計算した「キー」と「バリュー」と呼ばれる中間の計算結果を参照するため、これを保存しておく。この保存データが KVキャッシュで、入力が長いほど膨らみ、生成のたびに GPU の広帯域メモリー (HBM) から読み出される。1トークンあたりの KVキャッシュが小さければ、同じメモリーでより長い入力や多くの利用者のリクエストを処理でき、1トークンあたりの費用が下がる。仕組みと費用の計算式は KVキャッシュの手引き で詳しく扱った。
ディープシークが2026年9月10日に公開した V4.1-Flash の技術報告書によれば、同社のモデルの1トークンあたりの KVキャッシュ (直近のトークンだけを参照する部分を除き、入力全体を参照するためのもの) は、2023年11月の DeepSeek-V1 で389,120バイトだった。2025年12月の V3.2 で48,068バイトと8.1分の1になり、2026年4月の V4-Flash で3,514バイトとさらに13.7分の1に、V4.1-Flash で890バイトと3.9分の1になった。V1 と比べると437分の1である。
報告書は、KVキャッシュを減らす方法を3つに分けて整理している。1件あたりのデータを小さくする (キーとバリューの数を減らす、あるいは小さな1つのベクトルにまとめる)、複数のトークン分をまとめて1件にする、層の間で使い回す、の3つで、組み合わせるほど削減の効果が大きくなる。これに、保存する数値の精度を下げる方法が加わる。ディープシークは世代ごとに違う方法を重ねてきた。
V4.1-Flash で新たに加えたのは、層の間での使い回しと精度の引き下げである。40層のモデルを前半20層の「エンコーダー」と後半20層の「デコーダー」に分け、デコーダーが使う KVキャッシュはエンコーダーの最後の層の出力から作る。さらに各層の役割を、自分で KVキャッシュを作る層、前の層のものを借りて参照先を選び直す層、借りたものをそのまま使う層の3種類に固定し、KVキャッシュを作る層を絞り込んだ。保存する数値は4ビットの浮動小数点 (FP4) に下げた。これで KVキャッシュは V4-Flash の約4分の1となり、常に HBM に置いておける大きさになった。直近のトークンだけを参照する部分のデータを SSD に残さない工夫と合わせ、再利用のために保存しておくデータは V4-Flash の約8分の1に減る。モデル全体のパラメーターは5,520億で、最大100万トークンの入力を扱える。1トークンの処理に使うパラメーターは、入力を読み込む段階で80億、文章を生成する段階で160億にとどまる。
890バイトは公開された設定値から1バイト単位で再現できる
ディープシークの公表値は、同社がハギングフェイスで公開している各版の設定ファイルと、同社の推論用ソフトウエア部品 FlashMLA の説明書に記された保存形式から計算し直せる。本誌が2026年9月22日に取得した設定値で計算すると、4世代とも公表値と一致した。
| 版 | 1トークンあたりのKVキャッシュの内訳 | 合計 |
|---|---|---|
| V1 | キーとバリューの2種類×95層×ヘッド8個×128次元×2バイト | 389,120バイト |
| V3.2 | 61層×(キーとバリュー656バイト+インデクサー用のキー132バイト) | 48,068バイト |
| V4-Flash | 1件584バイトのキーとバリューを、4トークンで1件の21層と128トークンで1件の20層に保存し、4トークンで1件の層にインデクサー用のキー68バイトを加える | 3,514バイト |
| V4.1-Flash | KVキャッシュを作る4層 (合わせて2.5件)×(FP4 のキーとバリュー288バイト+インデクサー用のキー68バイト) | 890バイト |
V1 は、キーとバリューのヘッドを8個持つ標準的な構成だった。ヘッド1個の次元は、隠れ層の次元8,192をアテンションのヘッド数64で割った128で、1層あたり4,096バイトを95層分保存していた。V3.2 はキーとバリューを512次元の小さな1つのベクトルに圧縮し、8ビットの浮動小数点 (FP8) で保存したことで、1層あたり788バイトになった。1層あたりで5.2分の1、層の数も95から61へ減り、合わせて8.1分の1になる。V4-Flash は複数のトークン分をまとめる方法を取り入れ、21層では4トークン分を1件に、20層では128トークン分を1件にまとめた。1件は FP8 の数値448バイトと、精度を落とさない位置の情報128バイト、スケール係数8バイトの計584バイトで、キーとバリューだけで1トークンあたり3,157.25バイトになる。V4.1-Flash は KVキャッシュを作る層を第2・8・14・20層の4層に絞ったうえで、1件を FP8 の584バイトから FP4 の288バイト (4ビットの数値512個で256バイトと、16個ごとのスケール係数32バイト) に縮めた。
インデクサーは、長い入力の中から次に参照すべき位置を選ぶ小さな仕組みで、そのキーも KVキャッシュに含まれる。インデクサー用のキーの大きさは報告書にも説明書にも明記がなく、表の132バイトと68バイトは公表値から逆算した推定である。V4-Flash と V4.1-Flash を別々に逆算しても同じ68バイトになり、2つの計算が互いの裏付けになっている。437分の1は宣伝用の数字ではなく、公開された構成から誰でも確かめられる設計の結果である。
中国AIは利用量の7〜8割を占めるが支出は2〜4割、単価は米国製の約6分の1〜15分の1
効率の差は価格に表れる。ゴールドマン・サックスがオープンルーターのデータから作業の種類別に集計したところ、2026年9月7日からの1週間のトークンの利用量のうち、中国製モデルは一般的な用途の77%、AIエージェントの83%、コード生成の70%、データ処理の74%を占めた。同社は「中国製モデルは価格の競争力で利用量の過半を握っている」とみており、中国製モデルは利用の順位でも何度も上位に入ってきた。一方、9月7日時点の支出に占める割合では、中国製モデルは一般的な用途で22%、AIエージェントで36%、コード生成で29%、データ処理で16%にとどまり、残りの78%・64%・71%・84%は米国製モデルに支払われた。
2つの割合から、1トークンあたりの単価の開きを逆算できる。中国製と米国製の支出の比を、利用量の比で割れば、中国製モデルの単価を米国製モデルの単価で割った値になる。本誌の計算では、米国製モデルの単価は中国製モデルの、一般的な用途で11.9倍、AIエージェントで8.7倍、コード生成で5.7倍、データ処理で14.9倍だった。支出と利用量は集計の時点が1週間の中で少しずれるため、この倍率は推定である。
逆算の結果は、実際の価格表とも合う。オープンルーターが公開している価格表 (2026年9月22日取得) では、DeepSeek V4.1 Flash は100万トークンあたり入力0.15ドル・出力0.60ドル、同じ9月に出たグーグルの Gemini 3.8 Flash は入力0.75ドル・出力3.75ドルで、グーグルの方が入力で5倍、出力で6.25倍高い。同じ軽量版どうしでも、逆算した倍率の最も小さいコード生成の5.7倍と同じ程度の差がある。ゴールドマン・サックスは、安い中国製モデルの採用が進むにつれて大規模言語モデルの1トークンあたりの平均価格が下がり、世界の推論サービスの価格に値下げ圧力がかかっていると指摘した。投資家にとっては、中国製モデルの利用量の割合を、そのまま売上高の割合と読み替えてはいけないということになる。利用量で7〜8割を占めても、金額では2〜4割にとどまる。
AIエージェントとコード生成で中国勢の支出の割合が7月から伸び、KVキャッシュの小ささが長い作業の費用に効く
伸びは、より価値の高い用途に広がっている。ゴールドマン・サックスによれば、支出に占める中国製モデルの割合は、AIエージェントで7月の13%から9月の36%へ、コード生成で16%から29%へ上がった。一般的な対話だけでなく、支払額の大きい用途でも金額の割合を伸ばしている。
KVキャッシュの小ささが最も効くのが、この2つの用途である。AIエージェントは外部のツールを何度も呼び出し、そのたびに長い入力を読み込み直すため、入力の読み込みとメモリーの使用量が費用を左右する。ディープシークは技術報告書で、KVキャッシュの大きさが推論の処理能力を下げ、運用の費用を押し上げ、長い作業をこなすAIエージェントの普及を妨げると書いた。V4.1-Flash でエンコーダーとデコーダーに分けたのも、入力の多いAIエージェントの作業で費用の効率を高めるためだと説明している。記者の見立てでは、AIエージェントで支出の割合が伸びたことは、この設計の狙いと合致している。
ゴールドマン・サックスは、次の主戦場をAIエージェントと、AIが人に代わって仕事をこなす「デジタル労働」とみる。その用途はプログラムの作成から、金融、法務、会計など事務職の業務全般へ広がるという。いずれも長い文書を読み込み、何段階もの作業を重ねる仕事で、1トークンあたりの KVキャッシュの大きさがそのまま費用に響く。ディープシークの会社の概要は ディープシークの企業ページ で確認できる。
米国勢が設備投資で中国勢の約7倍を投じる一方、ディープシークは1トークンあたりの KVキャッシュを437分の1に減らし、その減らし方は公開された設定値から1バイト単位で再現できる。この効率が単価を米国製モデルの約6分の1〜15分の1に押し下げ、中国製モデルに利用量の7〜8割をもたらした。ただし支出で見れば2〜4割にとどまり、利用量と金額の割合の差こそが、中国AIが安さで戦っている証拠である。
投資家向けの個別銘柄レポートと技術デューデリジェンスのご相談はこちら。
💬 この記事へのコメント 0
まだコメントはありません
最初のコメントを投稿してみましょう!⚠️ エラーが発生しました