制御と学習 — 運動学・動力学・二足歩行・強化学習・VLA
部品がそろっても、それを動かす制御がなければロボットは立てません。関節の角度から手の位置を求める運動学、力と加速度を結ぶ動力学、転ばずに歩くための ZMP、そして近年の強化学習と視覚・言語・行動モデル (VLA) まで、研究の入口に立てる水準で説明します。
入門は要点と図だけ、標準は仕組みまで、研究は式と論文の水準まで表示します。選んだ深さはこの端末に残ります。
制御は、周期の違う層を積み重ねて「何をするか」から「関節の電流」までつなぐ
- 上の層ほどゆっくり大きく考え、下の層ほど速く細かく直す
- 従来の制御は物理の式で動きを計算し、学習は試行錯誤と手本から動きを身につける
- 実際の人型ロボットは、2つを層ごとに組み合わせている
人型ロボットの制御は、頭脳と電源の章の図のように層になっています。「コップを取る」と決める層、手の道筋と足の置き場所を決める層、全身の関節に力を配って転ばないようにする層、そして関節ごとに角度と力を合わせる層です。この章では、物理の式で動きを計算する従来の方法 (運動学・動力学・歩行の制御) と、近年急速に広がった学習による方法 (強化学習・模倣学習・VLA モデル) を順に説明します。
どちらか一方が勝つわけではありません。関節の角度を合わせる最も下の層は、今も物理の式に基づく制御が中心です。一方、歩き方や物のつかみ方のように、式で書き切れない動きは学習で身につける例が増えています。
運動学 — 関節の角度から手の位置を求める、手の目標から関節の角度を求める
- 関節の角度 → 手先の位置 を求めるのが順運動学 (答えは1つ)
- 手先の目標 → 関節の角度 を求めるのが逆運動学 (答えが無い・複数ある)
- 腕の自由度が7あると、同じ手先の位置でも肘の位置を選べる
肩・肘・手首の角度が分かれば、手先がどこにあるかは幾何学で1つに決まります。これを順運動学と呼びます。反対に、手先をコップの位置へ持っていくには、各関節を何度にすればよいかを求めなければなりません。これが逆運動学で、答えが1つとは限らず、届かない場所では答えがありません。
人間の腕は肩3・肘1・手首3の7自由度で、手先の位置と向き (6つの値) を決めても、肘の高さを選ぶ余地が1つ残ります。この余り (冗長性) を使うと、障害物を避けたり、関節の限界から離れた楽な姿勢を選んだりできます。人型ロボットの腕も7自由度前後で作ることが多いのはこのためです。ロボットの腕の制御は、本誌のロボットアームの制御の記事で具体的な計算とともに扱いました。
研究関節の角度を並べたベクトルを q、手先の位置と向きを x とすると、順運動学は x = f(q) です。両辺を時間で微分すると、関節の速さと手先の速さはヤコビ行列 J で結ばれます。
動力学 — 人型ロボットは床に固定されておらず、足の裏の力でしか体を動かせない
- 動力学は、関節の力と体の加速度の関係を扱う
- 産業用ロボットは床に固定されているが、人型ロボットの胴は宙に浮いている
- 胴を動かせるのは、足の裏 (と手) が床や物から受ける力だけ
運動学が「形」を扱うのに対し、動力学は「力」を扱います。重い物を持てば肩にかかる力が増え、腕を速く振れば反動で体が揺れます。産業用ロボットは土台が床にボルトで固定されているので、反動は床が受け止めます。人型ロボットの胴は床に固定されておらず、体を支え、動かせるのは、足の裏が床から受ける力だけです。足の裏が滑ったり浮いたりすれば、体を思いどおりに動かせなくなります。これが人型ロボットの制御を難しくしている根本の理由です。
研究胴の位置と向き (6自由度) も変数に含めた運動方程式は、次の形になります。
二足歩行の基本は、足の裏にかかる力の中心 (ZMP) を足の裏の範囲に収め続けること
- ZMP は、足の裏が床から受ける力の合力が作用する点
- ZMP が足の裏 (両足なら両足を囲む範囲) の中にあれば、足は浮かずに転ばない
- 体を振り子とみなして先の動きを予測し、ZMP を収める重心の動きを計画する
二足歩行の制御で最も基本となる考え方がZMP (ゼロモーメントポイント)です。足の裏は床から多くの点で力を受けていますが、それを1つの力にまとめたとき、その力が作用する点が ZMP です。ZMP が足の裏の範囲 (両足で立っていれば両足を囲む範囲) の内側にあれば、足は床から浮かず、体は倒れません。範囲の端に達すると、足の縁を軸にして体が倒れ始めます。
歩くときは、片足で立つ時間があり、その間の範囲は片足の裏だけになります。そこで、少し先までの重心の動きを予測し、ZMP が常に足の裏に収まるように重心の動きと次の足の置き場所を計画します。計算を速くするため、体を「重心と足を結ぶ棒」とみなす倒立振子モデルがよく使われます。この分野は日本の研究が長く先導してきました。ZMP の考え方を実機で初めて使って動的に歩いたのは、1984年の早稲田大学の脚ロボット WL-10RD です。2000年のホンダの ASIMO は、床反力・目標 ZMP・着地位置の3つの制御を組み合わせて歩きました。ZMP は歩行の設計の土台で、それだけで歩けるわけではありません。
研究重心の高さを一定 zc に保つと仮定した線形倒立振子モデルでは、水平の重心の位置 x と ZMP の位置 p の関係は次の簡単な式になります。
主な論文の年は次のとおりです。
| 年 | 考え方 | 意味 |
|---|---|---|
| 1968年 | ZMP の考え方 (ヴコブラトヴィッチとユリチッチ) | 足の裏にかかる力の中心を足の裏に収めれば転ばない、という考え方を示した。「ZMP」という名前が付いたのは1970年代初め |
| 1984年 | 初めての実機での動歩行 (早稲田大学 WL-10RD) | ZMP の考え方を実機で使い、2本の脚で動的に歩いた |
| 1985年 | インピーダンス制御 (ホーガン) | 手先をばねとダンパーのようにふるまわせ、物に触れる作業を制御する枠組み |
| 1987年 | 作業空間の定式化 (ハティブ) | 手先の目標から全関節の力を決める考え方。後の全身制御の土台になった |
| 1991年・2001年 | 線形倒立振子モデル (梶田ほか) | 重心の高さを一定とみなし、歩行の計画を速く解けるようにした。2001年に3次元に広げた |
| 2003年 | ZMP の予見制御 (梶田ほか) | 少し先 (1.6秒) までの ZMP の目標から、重心の動きを最適に決める方法。論文での検証はシミュレーション |
| 2006年 | キャプチャーポイント (プラットほか) | 倒れないために足を踏み出すべき場所を示す考え方 |
| 2018年 | 凸なモデル予測制御 (マサチューセッツ工科大学の四足ロボット) | 0.5秒先までの予測を1秒に20〜30回解き直し、秒速3メートルで走らせた。ボストン・ダイナミクスもアトラスの制御にモデル予測制御を使うと明かしている |
力の制御と全身制御 — 硬く正確に動くだけでなく、柔らかく触れる
- インピーダンス制御は、関節や手先をばねのように柔らかくふるまわせる
- 全身制御は、手の作業・バランス・関節の限界を同時に満たす関節の力を計算する
- 目標どうしがぶつかるときは、優先順位を付けて解く
位置だけを正確に合わせる制御では、人や物にぶつかったときに強い力が出てしまいます。インピーダンス制御は、手先や関節を、決めた硬さのばねと、揺れを抑えるダンパーのようにふるまわせる制御です。押されれば押された分だけ柔らかく退き、ドアを開ける・物を拭くといった、相手に触れながらの作業ができます。
人型ロボットは、手で作業しながらバランスを取り、関節の限界も守らなければなりません。これらの目標を同時に満たす全関節のトルクを、1秒に数百回の速さで最適化の問題として解くのが全身制御です。「転ばない」を最優先にし、手の作業をその次にするというように、目標に優先順位を付けて解きます。
学習 — 仮想空間で試行錯誤させ、人の手本をまねさせ、画像と言葉から動きを出す
- 強化学習は、仮想空間で何千台ものロボットを同時に試行錯誤させて歩き方を身につけさせる
- 模倣学習は、人が遠隔操作で見せた手本をまねさせて、手の作業を身につけさせる
- VLA モデルは、画像と言葉の指示から手足の動きを直接出す
強化学習は、うまくいった行動に点数を与え、点数が高くなる行動を試行錯誤で身につけさせる方法です。実物のロボットで何万回も転ばせるわけにはいかないので、物理の法則を計算するシミュレーターの中で、何千台ものロボットを同時に歩かせて学ばせます。GPU で並列に計算するシミュレーターの登場で、学習は大幅に速くなりました。2021年の論文では、4,096台を同時に計算し、平らな床の歩き方を GPU 1枚で4分足らずで学ばせています。
課題は、仮想空間と実物の差です。床の摩擦、モーターの反応の遅れ、部品の寸法のずれは、シミュレーターでは完全には再現できません。そこで、学習のたびに摩擦や重さをわざとばらつかせ、どの条件でも倒れない歩き方を身につけさせます (シミュレーションから実機への移行)。
手の作業は、点数の付け方を決めるのが難しいため、人がお手本を見せる模倣学習がよく使われます。人が遠隔操作でロボットを動かし、その記録をまねさせます。さらに近年は、画像と言葉の指示を受け取って手足の動きを直接出すVLA モデル (視覚・言語・行動モデル) が相次いで発表されています。インターネット上の大量の画像と文章で学んだ知識を、ロボットの動きに結びつける試みです。
| 発表 | 名前 (発表した組織) | 何をしたか |
|---|---|---|
| 2017年 | ドメインのランダム化 (トービンほか) | シミュレーターの見た目や物理の条件をばらつかせて学習し、実物でも通用させる方法 |
| 2019年 | 四足ロボットの強化学習 (チューリッヒ工科大学) | 実機のデータからアクチュエーターの特性を学ばせ、シミュレーターで学んだ歩き方を実物で使えるようにした |
| 2021年 | Isaac Gym (エヌビディア) と並列の強化学習 | GPU で4,096台を同時に計算し、平らな床の歩き方を GPU 1枚で4分足らずで学ばせた例が示された |
| 2023年 | RT-2 (グーグル・ディープマインド) | 画像と言葉を学んだ大きなモデルに、ロボットの動きを記号として出力させた。この論文が「VLA」という呼び名を定めた |
| 2023年 | Open X-Embodiment (多数の研究機関) | 22種類のロボットの100万件を超える動きの記録を1つの形式に集めて公開した |
| 2024年 | 人型ロボットの強化学習による歩行 (カリフォルニア大学バークレー校) | アジリティの Digit で、シミュレーターで学んだ歩き方を屋外で使った。学んだ動きは1秒に50回、関節の制御は1秒に1,000回 |
| 2024年 | π0 (フィジカル・インテリジェンス) | 33億の変数を持つ VLA モデル。自社で集めた約1万時間の動きのデータで学び、洗濯物を畳むなどの長い作業を示した |
| 2025年 | Helix (フィギュアAI・2月)・Gemini Robotics (グーグル・ディープマインド・3月)・GR00T N1 (エヌビディア・3月) | 人型ロボット向けの VLA モデルが相次いで発表された。どれも大きなモデルが1秒に数回〜10回「何をするか」を決め、小さなモデルが1秒に100〜200回動きを出す2層の構成。GR00T N1 の重みは非商用の使用に限って公開された |
| 2026年 | Helix 02 (フィギュアAI)・Gemini Robotics 2 (グーグル・ディープマインド) | Helix 02 は1秒に1,000回の層を加えた3層に。Gemini Robotics 2 は人型ロボットの全身の制御に広げた |
研究VLA モデルの多くは、画像と言葉を扱う大きなモデルの上に、滑らかな関節の動きを出す小さなモデルを重ねた2層の構成を取ります。大きなモデルが1秒に数回〜10回「何をするか」を決め、小さなモデルが1秒に100〜200回の速さで関節の目標を出します (フィギュアの Helix は7〜9回と200回、エヌビディアの GR00T N1 は10回と120回)。ボストン・ダイナミクスは2025年、アトラスに4.5億の変数を持つモデルを1秒に30回動かし、1回に48手先までの動きを出させていると発表しました。これは頭脳の階層と同じ考え方です。最大の課題はデータの量で、言葉の AI が使うインターネットの文章に比べ、ロボットの動きのデータは桁違いに少なく、遠隔操作の記録の収集・シミュレーターでの生成・人の動画からの学習を組み合わせて補う研究が続いています。
研究の入口 — 教科書・シミュレーター・公開データ
教科書 (基礎)
リンチとパークの教科書 (2017年、英語) は運動学・動力学・制御を1冊で扱い、本文と講義の動画が無料で公開されている。シチリアーノほかの教科書 (2009年、英語) も定番。教科書 (人型)
梶田秀司 編著『ヒューマノイドロボット』(オーム社) は、ZMP と倒立振子モデルによる歩行の制御を日本語で体系的に学べる。シミュレーター
物理の計算の MuJoCo (2022年に公開のソフトになった)、エヌビディアの Isaac Lab など。強化学習と模倣学習の研究は、まずシミュレーターで試すのが一般的。公開データと公開モデル
Open X-Embodiment のような公開のデータ、研究に使える公開の VLA モデル (フィジカル・インテリジェンスの openpi、エヌビディアの GR00T など) を使えば、大きな設備が無くても学習の研究を始められる。モデルごとに商用の使用の条件が違うので、使う前に許諾の範囲を確かめる。この章の確認
順運動学と逆運動学の違いを説明してください。逆運動学の答えが1つに決まらないのはどんなときですか。
順運動学は関節の角度から手先の位置を求め、答えは1つ。逆運動学は手先の目標から関節の角度を求める。腕の自由度が手先の位置と向きの数 (6) より多いと答えが無数にあり、届かない場所では答えが無い。
ZMP が足の裏の範囲の端に達すると何が起きますか。
足の縁を軸にして体が倒れ始める (足が床から浮く)。ZMP を足の裏の範囲の内側に収め続けることが、二足歩行で転ばないための基本の条件になる。
シミュレーターで学んだ歩き方を実物で使うとき、なぜ摩擦や重さをわざとばらつかせて学習させるのですか。
床の摩擦・モーターの遅れ・部品の寸法のずれはシミュレーターで完全には再現できないから。条件をばらつかせて学ばせると、どの条件でも倒れない歩き方になり、実物との差に強くなる。
この章の出所
- ヴコブラトヴィッチほか 二足歩行の安定と ZMP の論文 (1968〜1972年)
- N. ホーガン インピーダンス制御の論文 (米機械学会誌) (1985年)
- 梶田秀司ほか 3次元の線形倒立振子モデルの論文 (国際会議 IROS) (2001年)
- 梶田秀司ほか ZMP の予見制御による歩行の論文 (国際会議 ICRA) (2003年)
- J. プラットほか キャプチャーポイントの論文 (国際会議 Humanoids) (2006年)
- J. トービンほか ドメインのランダム化の論文 (2017年) — 原典
- V. マコヴィチュクほか Isaac Gym の論文 (2021年) — 原典
- グーグル・ディープマインド RT-2 の論文 (2023年) — 原典
- Open X-Embodiment の論文 (2023年) — 原典
- フィジカル・インテリジェンス π0 の論文 (2024年) — 原典
- エヌビディア GR00T N1 の論文 (2025年) — 原典
- K. リンチ・F. パーク ロボット工学の教科書 (本文と講義の動画を公開) (2017年) — 原典
一次資料との照合: 2026-09-24。企業の数字は各社の開示、技術の数字はメーカーの技術資料と論文から取りました。二次情報 (報道・証券会社の資料を引いた投稿) の値は、その旨を本文に書いています。
🧰 ツール・特集の入口
一次データで動く 14 本 — 銘柄の絞り込み・供給網・比較・一次データの台帳・解説・規制レンズ (すべて無料)