ロボット技術 体系解説 / 第6章 上級 読む目安 20分

制御と学習 — 運動学・動力学・二足歩行・強化学習・VLA

部品がそろっても、それを動かす制御がなければロボットは立てません。関節の角度から手の位置を求める運動学、力と加速度を結ぶ動力学、転ばずに歩くための ZMP、そして近年の強化学習と視覚・言語・行動モデル (VLA) まで、研究の入口に立てる水準で説明します。

入門は要点と図だけ、標準は仕組みまで、研究は式と論文の水準まで表示します。選んだ深さはこの端末に残ります。

制御は、周期の違う層を積み重ねて「何をするか」から「関節の電流」までつなぐ

要点
  • 上の層ほどゆっくり大きく考え、下の層ほど速く細かく直す
  • 従来の制御は物理の式で動きを計算し、学習は試行錯誤と手本から動きを身につける
  • 実際の人型ロボットは、2つを層ごとに組み合わせている

人型ロボットの制御は、頭脳と電源の章の図のように層になっています。「コップを取る」と決める層、手の道筋と足の置き場所を決める層、全身の関節に力を配って転ばないようにする層、そして関節ごとに角度と力を合わせる層です。この章では、物理の式で動きを計算する従来の方法 (運動学・動力学・歩行の制御) と、近年急速に広がった学習による方法 (強化学習・模倣学習・VLA モデル) を順に説明します。

どちらか一方が勝つわけではありません。関節の角度を合わせる最も下の層は、今も物理の式に基づく制御が中心です。一方、歩き方や物のつかみ方のように、式で書き切れない動きは学習で身につける例が増えています。

運動学 — 関節の角度から手の位置を求める、手の目標から関節の角度を求める

要点
  • 関節の角度 → 手先の位置 を求めるのが順運動学 (答えは1つ)
  • 手先の目標 → 関節の角度 を求めるのが逆運動学 (答えが無い・複数ある)
  • 腕の自由度が7あると、同じ手先の位置でも肘の位置を選べる

肩・肘・手首の角度が分かれば、手先がどこにあるかは幾何学で1つに決まります。これを順運動学と呼びます。反対に、手先をコップの位置へ持っていくには、各関節を何度にすればよいかを求めなければなりません。これが逆運動学で、答えが1つとは限らず、届かない場所では答えがありません。

人間の腕は肩3・肘1・手首3の7自由度で、手先の位置と向き (6つの値) を決めても、肘の高さを選ぶ余地が1つ残ります。この余り (冗長性) を使うと、障害物を避けたり、関節の限界から離れた楽な姿勢を選んだりできます。人型ロボットの腕も7自由度前後で作ることが多いのはこのためです。ロボットの腕の制御は、本誌のロボットアームの制御の記事で具体的な計算とともに扱いました。

研究関節の角度を並べたベクトルを q、手先の位置と向きを x とすると、順運動学は x = f(q) です。両辺を時間で微分すると、関節の速さと手先の速さはヤコビ行列 J で結ばれます。

ẋ = J(q) q̇ / τ = J(q)ᵀ F2つ目の式は、手先に力 F を出すのに必要な関節のトルク τ。逆運動学は、J の逆 (冗長なら擬似逆行列) を使って少しずつ解くのが一般的。J の階数が落ちる姿勢 (特異姿勢) では、手先を動かせない向きが生じ、関節の速さが発散しやすい。

動力学 — 人型ロボットは床に固定されておらず、足の裏の力でしか体を動かせない

要点
  • 動力学は、関節の力と体の加速度の関係を扱う
  • 産業用ロボットは床に固定されているが、人型ロボットの胴は宙に浮いている
  • 胴を動かせるのは、足の裏 (と手) が床や物から受ける力だけ

運動学が「形」を扱うのに対し、動力学は「力」を扱います。重い物を持てば肩にかかる力が増え、腕を速く振れば反動で体が揺れます。産業用ロボットは土台が床にボルトで固定されているので、反動は床が受け止めます。人型ロボットの胴は床に固定されておらず、体を支え、動かせるのは、足の裏が床から受ける力だけです。足の裏が滑ったり浮いたりすれば、体を思いどおりに動かせなくなります。これが人型ロボットの制御を難しくしている根本の理由です。

研究胴の位置と向き (6自由度) も変数に含めた運動方程式は、次の形になります。

M(q) q̈ + C(q, q̇) q̇ + g(q) = Sᵀ τ + Σ Jcᵀ FcM は慣性の行列、C は遠心力とコリオリ力、g は重力。S は関節だけを選ぶ行列で、胴の6自由度には直接トルクを加えられない (劣駆動)。Fc は足の裏などの接触点で受ける力で、床を押すことしかできない (引けない)・摩擦の範囲を超えると滑る、という制約がある。

二足歩行の基本は、足の裏にかかる力の中心 (ZMP) を足の裏の範囲に収め続けること

要点
  • ZMP は、足の裏が床から受ける力の合力が作用する点
  • ZMP が足の裏 (両足なら両足を囲む範囲) の中にあれば、足は浮かずに転ばない
  • 体を振り子とみなして先の動きを予測し、ZMP を収める重心の動きを計画する
上から見た足の裏 ZMP 破線 = 両足を囲む範囲 (支持多角形) 転ばないための条件 ・ZMP が破線の範囲の内側にある → 足は浮かない ・範囲の端に達する → 足の縁を軸に体が倒れ始める 歩くときは片足で立つ時間があり、範囲は片足の裏だけ になる。次の足をどこに置くかで範囲を先回りして 作り、重心の動きをそこに合わせて計画する
本誌作成。ZMP (ゼロモーメントポイント) は、床から受ける力の合力の作用点で、足を倒そうとする回転の力 (モーメント) が0になる点。

二足歩行の制御で最も基本となる考え方がZMP (ゼロモーメントポイント)です。足の裏は床から多くの点で力を受けていますが、それを1つの力にまとめたとき、その力が作用する点が ZMP です。ZMP が足の裏の範囲 (両足で立っていれば両足を囲む範囲) の内側にあれば、足は床から浮かず、体は倒れません。範囲の端に達すると、足の縁を軸にして体が倒れ始めます。

歩くときは、片足で立つ時間があり、その間の範囲は片足の裏だけになります。そこで、少し先までの重心の動きを予測し、ZMP が常に足の裏に収まるように重心の動きと次の足の置き場所を計画します。計算を速くするため、体を「重心と足を結ぶ棒」とみなす倒立振子モデルがよく使われます。この分野は日本の研究が長く先導してきました。ZMP の考え方を実機で初めて使って動的に歩いたのは、1984年の早稲田大学の脚ロボット WL-10RD です。2000年のホンダの ASIMO は、床反力・目標 ZMP・着地位置の3つの制御を組み合わせて歩きました。ZMP は歩行の設計の土台で、それだけで歩けるわけではありません。

研究重心の高さを一定 zc に保つと仮定した線形倒立振子モデルでは、水平の重心の位置 x と ZMP の位置 p の関係は次の簡単な式になります。

ẍ = (g / zc) × (x − p)g は重力の加速度。重心が ZMP より前にあると、重心は前へ加速する。少し先までの ZMP の目標を与え、この式で重心の動きを最適に決める方法 (予見制御) や、倒れないために「どこに足を踏み出せば止まれるか」を示すキャプチャーポイントの考え方が、この式から導かれる。制約付きの最適化で毎回解き直すモデル予測制御は、足の置き場所と重心の動きを同時に決められる。

主な論文の年は次のとおりです。

考え方意味
1968年ZMP の考え方 (ヴコブラトヴィッチとユリチッチ)足の裏にかかる力の中心を足の裏に収めれば転ばない、という考え方を示した。「ZMP」という名前が付いたのは1970年代初め
1984年初めての実機での動歩行 (早稲田大学 WL-10RD)ZMP の考え方を実機で使い、2本の脚で動的に歩いた
1985年インピーダンス制御 (ホーガン)手先をばねとダンパーのようにふるまわせ、物に触れる作業を制御する枠組み
1987年作業空間の定式化 (ハティブ)手先の目標から全関節の力を決める考え方。後の全身制御の土台になった
1991年・2001年線形倒立振子モデル (梶田ほか)重心の高さを一定とみなし、歩行の計画を速く解けるようにした。2001年に3次元に広げた
2003年ZMP の予見制御 (梶田ほか)少し先 (1.6秒) までの ZMP の目標から、重心の動きを最適に決める方法。論文での検証はシミュレーション
2006年キャプチャーポイント (プラットほか)倒れないために足を踏み出すべき場所を示す考え方
2018年凸なモデル予測制御 (マサチューセッツ工科大学の四足ロボット)0.5秒先までの予測を1秒に20〜30回解き直し、秒速3メートルで走らせた。ボストン・ダイナミクスもアトラスの制御にモデル予測制御を使うと明かしている

力の制御と全身制御 — 硬く正確に動くだけでなく、柔らかく触れる

要点
  • インピーダンス制御は、関節や手先をばねのように柔らかくふるまわせる
  • 全身制御は、手の作業・バランス・関節の限界を同時に満たす関節の力を計算する
  • 目標どうしがぶつかるときは、優先順位を付けて解く

位置だけを正確に合わせる制御では、人や物にぶつかったときに強い力が出てしまいます。インピーダンス制御は、手先や関節を、決めた硬さのばねと、揺れを抑えるダンパーのようにふるまわせる制御です。押されれば押された分だけ柔らかく退き、ドアを開ける・物を拭くといった、相手に触れながらの作業ができます。

人型ロボットは、手で作業しながらバランスを取り、関節の限界も守らなければなりません。これらの目標を同時に満たす全関節のトルクを、1秒に数百回の速さで最適化の問題として解くのが全身制御です。「転ばない」を最優先にし、手の作業をその次にするというように、目標に優先順位を付けて解きます。

学習 — 仮想空間で試行錯誤させ、人の手本をまねさせ、画像と言葉から動きを出す

要点
  • 強化学習は、仮想空間で何千台ものロボットを同時に試行錯誤させて歩き方を身につけさせる
  • 模倣学習は、人が遠隔操作で見せた手本をまねさせて、手の作業を身につけさせる
  • VLA モデルは、画像と言葉の指示から手足の動きを直接出す

強化学習は、うまくいった行動に点数を与え、点数が高くなる行動を試行錯誤で身につけさせる方法です。実物のロボットで何万回も転ばせるわけにはいかないので、物理の法則を計算するシミュレーターの中で、何千台ものロボットを同時に歩かせて学ばせます。GPU で並列に計算するシミュレーターの登場で、学習は大幅に速くなりました。2021年の論文では、4,096台を同時に計算し、平らな床の歩き方を GPU 1枚で4分足らずで学ばせています。

課題は、仮想空間と実物の差です。床の摩擦、モーターの反応の遅れ、部品の寸法のずれは、シミュレーターでは完全には再現できません。そこで、学習のたびに摩擦や重さをわざとばらつかせ、どの条件でも倒れない歩き方を身につけさせます (シミュレーションから実機への移行)。

手の作業は、点数の付け方を決めるのが難しいため、人がお手本を見せる模倣学習がよく使われます。人が遠隔操作でロボットを動かし、その記録をまねさせます。さらに近年は、画像と言葉の指示を受け取って手足の動きを直接出すVLA モデル (視覚・言語・行動モデル) が相次いで発表されています。インターネット上の大量の画像と文章で学んだ知識を、ロボットの動きに結びつける試みです。

発表名前 (発表した組織)何をしたか
2017年ドメインのランダム化 (トービンほか)シミュレーターの見た目や物理の条件をばらつかせて学習し、実物でも通用させる方法
2019年四足ロボットの強化学習 (チューリッヒ工科大学)実機のデータからアクチュエーターの特性を学ばせ、シミュレーターで学んだ歩き方を実物で使えるようにした
2021年Isaac Gym (エヌビディア) と並列の強化学習GPU で4,096台を同時に計算し、平らな床の歩き方を GPU 1枚で4分足らずで学ばせた例が示された
2023年RT-2 (グーグル・ディープマインド)画像と言葉を学んだ大きなモデルに、ロボットの動きを記号として出力させた。この論文が「VLA」という呼び名を定めた
2023年Open X-Embodiment (多数の研究機関)22種類のロボットの100万件を超える動きの記録を1つの形式に集めて公開した
2024年人型ロボットの強化学習による歩行 (カリフォルニア大学バークレー校)アジリティの Digit で、シミュレーターで学んだ歩き方を屋外で使った。学んだ動きは1秒に50回、関節の制御は1秒に1,000回
2024年π0 (フィジカル・インテリジェンス)33億の変数を持つ VLA モデル。自社で集めた約1万時間の動きのデータで学び、洗濯物を畳むなどの長い作業を示した
2025年Helix (フィギュアAI・2月)・Gemini Robotics (グーグル・ディープマインド・3月)・GR00T N1 (エヌビディア・3月)人型ロボット向けの VLA モデルが相次いで発表された。どれも大きなモデルが1秒に数回〜10回「何をするか」を決め、小さなモデルが1秒に100〜200回動きを出す2層の構成。GR00T N1 の重みは非商用の使用に限って公開された
2026年Helix 02 (フィギュアAI)・Gemini Robotics 2 (グーグル・ディープマインド)Helix 02 は1秒に1,000回の層を加えた3層に。Gemini Robotics 2 は人型ロボットの全身の制御に広げた

研究VLA モデルの多くは、画像と言葉を扱う大きなモデルの上に、滑らかな関節の動きを出す小さなモデルを重ねた2層の構成を取ります。大きなモデルが1秒に数回〜10回「何をするか」を決め、小さなモデルが1秒に100〜200回の速さで関節の目標を出します (フィギュアの Helix は7〜9回と200回、エヌビディアの GR00T N1 は10回と120回)。ボストン・ダイナミクスは2025年、アトラスに4.5億の変数を持つモデルを1秒に30回動かし、1回に48手先までの動きを出させていると発表しました。これは頭脳の階層と同じ考え方です。最大の課題はデータの量で、言葉の AI が使うインターネットの文章に比べ、ロボットの動きのデータは桁違いに少なく、遠隔操作の記録の収集・シミュレーターでの生成・人の動画からの学習を組み合わせて補う研究が続いています。

研究の入口 — 教科書・シミュレーター・公開データ

教科書 (基礎)

リンチとパークの教科書 (2017年、英語) は運動学・動力学・制御を1冊で扱い、本文と講義の動画が無料で公開されている。シチリアーノほかの教科書 (2009年、英語) も定番。

教科書 (人型)

梶田秀司 編著『ヒューマノイドロボット』(オーム社) は、ZMP と倒立振子モデルによる歩行の制御を日本語で体系的に学べる。

シミュレーター

物理の計算の MuJoCo (2022年に公開のソフトになった)、エヌビディアの Isaac Lab など。強化学習と模倣学習の研究は、まずシミュレーターで試すのが一般的。

公開データと公開モデル

Open X-Embodiment のような公開のデータ、研究に使える公開の VLA モデル (フィジカル・インテリジェンスの openpi、エヌビディアの GR00T など) を使えば、大きな設備が無くても学習の研究を始められる。モデルごとに商用の使用の条件が違うので、使う前に許諾の範囲を確かめる。

この章の確認

順運動学と逆運動学の違いを説明してください。逆運動学の答えが1つに決まらないのはどんなときですか。

順運動学は関節の角度から手先の位置を求め、答えは1つ。逆運動学は手先の目標から関節の角度を求める。腕の自由度が手先の位置と向きの数 (6) より多いと答えが無数にあり、届かない場所では答えが無い。

ZMP が足の裏の範囲の端に達すると何が起きますか。

足の縁を軸にして体が倒れ始める (足が床から浮く)。ZMP を足の裏の範囲の内側に収め続けることが、二足歩行で転ばないための基本の条件になる。

シミュレーターで学んだ歩き方を実物で使うとき、なぜ摩擦や重さをわざとばらつかせて学習させるのですか。

床の摩擦・モーターの遅れ・部品の寸法のずれはシミュレーターで完全には再現できないから。条件をばらつかせて学ばせると、どの条件でも倒れない歩き方になり、実物との差に強くなる。

この章の出所

  1. ヴコブラトヴィッチほか 二足歩行の安定と ZMP の論文 (1968〜1972年)
  2. N. ホーガン インピーダンス制御の論文 (米機械学会誌) (1985年)
  3. 梶田秀司ほか 3次元の線形倒立振子モデルの論文 (国際会議 IROS) (2001年)
  4. 梶田秀司ほか ZMP の予見制御による歩行の論文 (国際会議 ICRA) (2003年)
  5. J. プラットほか キャプチャーポイントの論文 (国際会議 Humanoids) (2006年)
  6. J. トービンほか ドメインのランダム化の論文 (2017年) — 原典
  7. V. マコヴィチュクほか Isaac Gym の論文 (2021年) — 原典
  8. グーグル・ディープマインド RT-2 の論文 (2023年) — 原典
  9. Open X-Embodiment の論文 (2023年) — 原典
  10. フィジカル・インテリジェンス π0 の論文 (2024年) — 原典
  11. エヌビディア GR00T N1 の論文 (2025年) — 原典
  12. K. リンチ・F. パーク ロボット工学の教科書 (本文と講義の動画を公開) (2017年) — 原典

一次資料との照合: 2026-09-24。企業の数字は各社の開示、技術の数字はメーカーの技術資料と論文から取りました。二次情報 (報道・証券会社の資料を引いた投稿) の値は、その旨を本文に書いています。

🧰 ツール・特集の入口

一次データで動く 14 本 — 銘柄の絞り込み・供給網・比較・一次データの台帳・解説・規制レンズ (すべて無料)

銘柄スキャナー 日本株 563 社を有報の連結実数・空売り残高・逆日歩・信用残・自社株買い・大株主の増減で絞り込む (無料・登録不要) 型: 成長株に空売りが厚い ほか 6 種開く → 注目IPO一覧 直近の新規上場を上場日順に。どんな会社か一言・主な事業・注目テーマ・公開価格・初値と騰落率・吸収金額・売上の推移を目論見書と JPX 新規上場会社情報から確かめて 1 社 1 行で 公開価格・初値・売上の推移開く → サプライチェーン3Dマップ 日本株と NVIDIA・TSMC・SMIC など世界の半導体・AI 企業のつながりを 3D ネットワークで俯瞰。銘柄をクリックして供給網をたどる 日本株×世界の供給網開く → AI企業 比較ツール オープンAI・アンソロピック・グーグル等の主要 AI 企業を、開示の実数と主力モデルで横並び比較 横並び比較開く → 半導体企業 比較ツール エヌビディア・TSMC・ASML から東京エレクトロン・ディスコまで、工程・製品・日本企業との取引で横並び比較 横並び比較開く → 系統用蓄電所ランキング 上場48社 送電網に直結した系統用蓄電所のうち、稼働中の設備に一次ソースで名前が出る上場企業 48 社を蓄電容量の企業別合算で順位付け 一次ソースの台帳 (2026-09-12 時点)開く → 世界のデータセンター一覧 世界 169 か国 5,875 拠点のデータセンターを日本語で一覧化。運営事業者・所在都市・接続ネットワーク数・回線事業者数から設置先を比較 施設データベース開く → AI計算資源・大規模モデル 体系解説 トークン化・注意機構・自己回帰・MoE の仕組みから、FLOPS・トークン原価・GPU クラウドの収支・冷却まで、設計理由を投資家視点で 体系解説開く → 蓄電事業 体系解説 系統用蓄電池の基礎、設備と系統接続、3つの市場と長期オークションの収支、日本と米国・G7の市場、投資前の確認表。収支シミュレーター付き 体系解説開く → 蓄電池の補助金一覧 産業用蓄電池と系統用蓄電池の国の補助金を、補助率・上限・公募期間・要件で比較。受付中の事業と補助額の概算 補助金開く → Postation AIアカデミー IPA の DX 推進スキル標準 6 類型 17 ロールを、理論・アルゴリズム・メカニズムの 3 視点で書き下ろした教科書 教科書開く → 半導体 用語辞典 半導体の技術用語を「とは」から引く索引。1 行定義と、基礎・高級・投資者視点の 3 段深度で 1 語 1 ページ 「とは」から引く開く → イラン制裁×中国製油所×日本株 イラン産原油禁輸の復活、中国独立系製油所 5 社への OFAC 制裁、ホルムズ海峡の戦争保険料を、規制タイムラインと日本株マップで 対中規制レンズ開く → 中国の対日輸出規制リスト×影響銘柄 中国商務部が 2026 年 2 月・6 月に指定した対日輸出規制の管理リスト 40 団体・注視リスト 40 団体と、リスト入りした日本企業・影響銘柄 対中規制レンズ開く →
日本で買えるEV データベース (国産・輸入) CEV補助金・実質価格・スペックを横断比較 — 購入検討はここから 今すぐ見る →