スケーリング則とは
読み: すけーりんぐそく Scaling Laws AI計算資源・大規模モデルの用語
スケーリング則とは、計算量・データ量・パラメータ数を増やすほど性能が予測可能に伸びるという経験則。AI投資の拡大を正当化してきた根拠であり、限界の議論も常にここから始まる。
3段で深く知る — 基礎・高級・投資家視点
1行の定義から、体系解説の該当箇所へそのまま降りられる。各段の抜粋は解説本文の冒頭で、続きはリンク先にある。
第II部 仕組み ③ 大規模モデルの構造 — パラメータの正体
「1750億パラメータ」「1兆パラメータ」のパラメータとは、モデル内部の重み行列を構成する数値1個1個のことである。 単位のB (Billion) は10億個。訓練とは、この膨大な数値の集合を、データに合うように少しずつ調整し続ける作業に他ならない。 3.1 規模の3区分 — 小型・中型・大型 パラメータは「個数」だが、実務ではそのままメモリ必要量に換算される (FP16なら1個2バイト。175Bモデルの重みだけで350GB)。 これがモデル規模と必要GPU数を直結させる。 10B・100Bという境界に公式の定義はない。本ページが説明のために置いた便宜的な区分である。 なおモデルファミリー名だけでは区分できない点にも注意がいる。たとえばGemmaもPhiも10Bを超えるモデルを含むため、 上表ではサイズを明記した。 3.2 スケーリング則 — 規模がそのまま性能になる、ただし作法が変わった…
第II部 仕組み ③ 大規模モデルの構造 — パラメータの正体
「1750億パラメータ」「1兆パラメータ」のパラメータとは、モデル内部の重み行列を構成する数値1個1個のことである。 単位のB (Billion) は10億個。訓練とは、この膨大な数値の集合を、データに合うように少しずつ調整し続ける作業に他ならない。 3.1 規模の3区分 — 小型・中型・大型 パラメータは「個数」だが、実務ではそのままメモリ必要量に換算される (FP16なら1個2バイト。175Bモデルの重みだけで350GB)。 これがモデル規模と必要GPU数を直結させる。 10B・100Bという境界に公式の定義はない。本ページが説明のために置いた便宜的な区分である。 なおモデルファミリー名だけでは区分できない点にも注意がいる。たとえばGemmaもPhiも10Bを超えるモデルを含むため、 上表ではサイズを明記した。 3.2 スケーリング則 — 規模がそのまま性能になる、ただし作法が変わった…
第III部 経済 ⑥ 計算資源提供事業の経済性 — GPU 1基の収支から読む
本節が本ページの核心である。計算資源提供 (GPUクラウド) は「GPUを買って時間貸しする」だけの単純な商売に見えるが、 収益性は稼働率・契約形態・電力原価・陳腐化速度の4変数でほぼ決まる。 以下は概算モデル (推定値は明記) と、業界内では常識だが対外的にはあまり語られない実務数値である。 6.1 GPU 1基の収支モデル (H100級・概算) この表の性格 — 外部機関の推計ではなく、本ページの試算である 取得原価はNVIDIAが公表していない。市場で報じられた水準を置いたものであり、一次情報は存在しない 稼働率は公開されない数字。事業者が開示しないため、ここでは幅を置いた仮定にとどまる 電力・冷却原価はGPUを実効1kW、PUEを織り込まない前提での概算。実際はサーバ側の消費とPUEが乗って1.2〜1.6kW相当になるため、下限は現実には出にくい したがってこの表に出典リンクは付け…