KVキャッシュとは
読み: けーぶいきゃっしゅ KV Cache AI計算資源・大規模モデルの用語
KVキャッシュとは、生成中に過去の文脈の計算結果を蓄えるメモリー領域。文脈長に比例してGPUメモリーを食うため、「128k対応」の物理的な裏側にあたる。
3段で深く知る — 基礎・高級・投資家視点
1行の定義から、体系解説の該当箇所へそのまま降りられる。各段の抜粋は解説本文の冒頭で、続きはリンク先にある。
第II部 仕組み ③ 大規模モデルの構造 — パラメータの正体
「1750億パラメータ」「1兆パラメータ」のパラメータとは、モデル内部の重み行列を構成する数値1個1個のことである。 単位のB (Billion) は10億個。訓練とは、この膨大な数値の集合を、データに合うように少しずつ調整し続ける作業に他ならない。 3.1 規模の3区分 — 小型・中型・大型 パラメータは「個数」だが、実務ではそのままメモリ必要量に換算される (FP16なら1個2バイト。175Bモデルの重みだけで350GB)。 これがモデル規模と必要GPU数を直結させる。 10B・100Bという境界に公式の定義はない。本ページが説明のために置いた便宜的な区分である。 なおモデルファミリー名だけでは区分できない点にも注意がいる。たとえばGemmaもPhiも10Bを超えるモデルを含むため、 上表ではサイズを明記した。 3.2 スケーリング則 — 規模がそのまま性能になる、ただし作法が変わった…
第II部 仕組み ③ 大規模モデルの構造 — パラメータの正体
「1750億パラメータ」「1兆パラメータ」のパラメータとは、モデル内部の重み行列を構成する数値1個1個のことである。 単位のB (Billion) は10億個。訓練とは、この膨大な数値の集合を、データに合うように少しずつ調整し続ける作業に他ならない。 3.1 規模の3区分 — 小型・中型・大型 パラメータは「個数」だが、実務ではそのままメモリ必要量に換算される (FP16なら1個2バイト。175Bモデルの重みだけで350GB)。 これがモデル規模と必要GPU数を直結させる。 10B・100Bという境界に公式の定義はない。本ページが説明のために置いた便宜的な区分である。 なおモデルファミリー名だけでは区分できない点にも注意がいる。たとえばGemmaもPhiも10Bを超えるモデルを含むため、 上表ではサイズを明記した。 3.2 スケーリング則 — 規模がそのまま性能になる、ただし作法が変わった…
第III部 経済 ④ 収益化の構造 — トークンはどう金に変わるか
モデル提供社の収益は大きく個人購読 (月額定額) と企業向けトークン従量課金 (API) の2本柱で、 これに大企業向けの専用容量契約が加わる。価格を決める変数は有効パラメータ量・文脈長・速度の3つに集約される。 4.1 個人購読 — 定額制は「保険」の商売である 月額20ドル前後の購読は、軽い利用者の払い過ぎが重い利用者の原価を補助する保険型の収益構造である。 提供側は利用上限・混雑時制限で重利用者の原価を抑え、全体で粗利を成立させる。 解約率が低く売上が読めるため、資本市場はAPI売上より購読売上を高く評価する傾向がある。 4.2 トークン従量課金 — 価格表の読み方 API価格は「入力100万トークンあたり / 出力100万トークンあたり」で表示される。 出力が入力の約5倍高いのは気まぐれではなく、入力の読込 (プリフィル) は一括並列で安く処理できるのに対し、 出力の生成 (デコー…