「ロボットにAIを載せる」「現場のデータを学習させる」——。日本のフィジカルAI報道では、しばしばここで説明が終わる。しかし、その視線が「どの機体に、どんなAIを載せるか」にとどまっている間に、グローバルでは5年後の産業構造を左右する競争が始まっている。
争われているのは、単体のロボットの賢さではない。ロボットの「知能」を、誰が、どのレイヤーで握るかだ。
機体をまたぐ基盤モデルに置くのか。器用な操作とタスク理解を担う汎用VLAに置くのか。それとも、特定の機体と業務プロセスを統合したシステム全体に埋め込むのか。この設計思想の違いが、データ戦略、事業モデル、参入障壁、ROIの出し方、投資回収までの時間軸を決める。
この構造を見誤れば、日本企業は高性能なロボットを導入できたとしても、知能とデータの主導権を握れない。自社の現場から生まれるデータを使って、海外ベンダーのモデルと競争力を育てるだけの存在になりかねない。
本稿では、TECHBLITZ編集部が過去に取材した米Skild AI(スキルド・エーアイ)とスイスのANYbotics(エニーボティクス)に、米Physical Intelligence(フィジカル・インテリジェンス)を加えた3社を取り上げる。Skild AIとPhysical Intelligenceは「汎用ロボット知能」という同じレイヤーで競い、ANYboticsはそこから外れた、別の商用化ルートを走っている。
ただし、3社の境界は固定されていない。モデル企業は現場とハードウエアへ降り、ロボット企業はソフトウエアとデータ基盤へ上がる。異なる場所から始まった3つの道は、すでに互いに接近しつつある。
日本企業が問うべきは、どのロボットを買うかではない。自社はどの知能設計に賭け、データと主導権を誰と分け合うのかだ。
💡記事のポイント
・ボトルネックは「AIの有無」ではなく、汎化の範囲だった
・Skild AIは身体をまたぐ適応に、Physical Intelligenceは手による器用な操作とタスク理解に、ANYboticsは単一機体と点検業務の全体最適に知能を置いた
・データ不足への打ち手(実機/シミュレーション/人間動画/VLMの世界知識)は、どれかを選ぶ選択肢ではなく材料。各社いずれも4つとも使っており、違いは配合比にある
・業界は二分されていない。モデル企業は現場とハードへ降り、垂直統合企業はソフトとデータ基盤へ上がる。両側から収斂が進んでいる
・器用な操作への汎化も、機体ごとの追加学習の削減も、まだ第三者検証を経ていない
目次
・第1章:ロボットの汎化を阻んできたもの
・第2章:Skild AIの回答、「暗記できない試験」を設計する
・第3章:Physical Intelligence、同じレイヤーの「手」強い対抗軸
・第4章:データ不足への打ち手は、「どれを選ぶか」ではない
第1章:ロボットの汎化を阻んできたもの
フィジカルAI時代に入って「ロボットにAIが搭載される」と聞くと、「これまでのロボットにAIは入っていなかった」と漠然と考えがちだが、この認識は正確ではない。むしろ、深層強化学習による脚型ロボットの歩行制御は10年近く前から研究され、実装されてきた。産業用ロボットの世界にはさらに長く、古典制御、モデルベース制御、ロバスト制御という成熟した体系がある。これらは決して「賢くない」技術ではない。むしろ条件が定義できる環境では、いまも学習ベースの手法より確実で、安全で、説明可能だ。
ボトルネックはAIの有無ではなく、汎化の範囲にあった。
とりわけ学習ベースの制御の一部には、特定の機体・環境・タスクへ過適合しやすい弱点がある。Skild AIは公開ブログで、これを「テストの答えを丸暗記すること」に例える。試験には通るが、答えの導き方は身についていない。だからモーターが詰まる、脚が折れる、想定外の重量物を持たされる、といった瞬間に解が役に立たなくなる。
同じ構造は古典的な手法にも形を変えて存在する。モデルベース制御は精緻な物理モデルを前提とするが、現場は前提を裏切る。摩擦係数が変わり、部品が摩耗し、昨日と違う箱が流れてくる。整った条件下で撮影されたデモ動画が現実で通用しない理由が、ここにある。
この「汎化の壁」に対して、3社はそれぞれ違う場所から挑んでいる。
第2章:Skild AIの回答、「暗記できない試験」を設計する
米ピッツバーグを拠点とするSkild AIの答えは、奇妙なほどシンプルだ。暗記が成立しない訓練環境をつくる。
同社によれば、シミュレーション上に10万体の異なるロボットを用意し、そのすべてを同じ1つのモデルに制御させた。1体分の解を覚えても残りで通用しないため、モデルは「多くの身体に共通して効く戦略」を探すしかない。同社が「オムニボディード(omni-bodied)」と呼ぶのは、この状態を指す。
結果として現れたのが「文脈内適応(in-context adaptation)」だ。同社が公開した検証によれば、太ももから先の脚を切断されて自由度が4つ失われた四足ロボットが、7〜8秒後に大きく脚を振る歩行を自力で見つける。車輪を固定されれば歩行に切り替え、解除されれば走行に戻る。いずれも学習データから除外した機体でのゼロショット動作だと説明されている。
同社はこれを、大規模言語モデルの「文脈内学習(in-context learning)」になぞらえる。ただし両者が同一のメカニズムだと確認されているわけではない。追加学習なしに直近の入力履歴から振る舞いを変えるという点で、機能的に似た適応が起きている──そう理解するのが妥当だろう。実際、失敗した試行を次の試行にプロンプトとして与えたところ3回目で成功した、という例が同社ブログに挙げられている。
押さえておきたいのは、同社の事業領域が基盤モデルだけにとどまっていないことだ。2026年3月にABB Robotics、Teradyne Robotics傘下のUniversal Robots(UR)およびMobile Industrial Robots(MiR)、NVIDIAとの提携を発表。翌4月にはZebra Technologiesのロボティクス・オートメーション事業(旧Fetch Robotics)を、倉庫向けオーケストレーション基盤「Symmetry Fulfillment」ごと買収した(詳細は第8章)。
共同創業者兼社長のアビナフ・グプタ(Abhinav Gupta)氏は2026年8月のインタビューで、同社のソフトウエアが工場・データセンター・物流拠点で数百台規模のロボット上で稼働していると語っている(同氏の説明による)。つまりSkild AIは、汎用基盤モデルを中核に据えつつ、実際の用途、ハードウエア、導入チャネルへも事業領域を広げている。「ロボットを1台も作らず頭脳だけを売る会社」という理解は、すでに古い。
第3章:Physical Intelligence、同じレイヤーの「手」強い対抗軸
同じレイヤーで最も手強い比較対象が、米Physical Intelligenceだ。
掲げる目標はSkild AIとほぼ重なる。あらゆるロボットに、あらゆるタスクをさせる単一のモデル。だが力点の置き方が違う。
主力のπ(パイ)シリーズは、視覚言語モデル(VLM)の上に行動生成を載せるVLA(Vision-Language-Action)として設計されている。2024年のπ0では、7種類のロボット構成・68タスクにわたる約1万時間の実機データを事前学習に用いた。皿の片付け、洗濯物たたみ、封筒詰め、配線の取り回し、電源プラグの挿入。並ぶタスクを見れば力点は明確だ。手である。
2026年4月に発表されたπ0.7は、この路線をさらに進めた。同社の論文によれば、π0.7は多様な言語指示に従い、器用さを要するタスクで専用に微調整されたモデルに匹敵する性能を出し、さらに学習済みの振る舞いを新しいかたちに組み合わせる──構成的汎化(compositional generalization)の強い兆候を示したという。言語モデルが知識を新しく組み合わせて未知の問題を解くのと似たことが、身体の動作でも起き始めているという主張だ。
興味深いのは実現手段だ。デモンストレーションに加え、自律実行で得た質の低いデータや失敗データ、人間の作業動画までを混ぜる。ただし単純に混ぜると、戦略も達成度も異なるデータが平均化されて性能が落ちる。そこで指示や達成度のメタデータを与え、「何をするか」だけでなく「どのやり方でやるか」まで条件付けする設計になっている。
Skild AIとの共通点は多い。単一モデルで複数機体を扱うこと。実機データだけでは足りないと認識していること。データフライホイールを重視すること。違いは重心だ。Skild AIが前面に出すのは、身体が壊れたり変わったりしたときの、低レイヤーの適応である。Physical Intelligenceが前面に出すのは、手による器用な操作、意味理解、そしてタスクの組み合わせだ。
この対比には実務的な意味がある。ロボットが歩けても、掴めなければ現場では使えない。人間の物理労働の価値の大半は移動ではなく操作にある。「デモは脚ばかりで、現場が求めるのは手だ」という批判に業界として答えているのが、Physical Intelligenceの路線である。
このレイヤーの競争は、スタートアップだけのものではない。Google DeepMindは2026年7月30日、Gemini Robotics 2を発表した。前世代が主に上半身の操作を対象としていたのに対し、新モデルはヒューマノイドの全身を単一の学習済み方策で制御し、複数ロボットの協調にも対応するとしている。数時間の学習データで新しい機体に適応できるとも説明されている。
ただし現時点で、全身制御モデルとオンデバイス版は早期アクセスのパートナーに限定されており、一般に購入できるわけではない。デモは展開ではない。この留保は、本稿で扱う3社すべてに等しく適用されるべきものだ。
第4章:データ不足への打ち手は、「どれを選ぶか」ではない
両社の違いの根底には、ロボティクス最大の構造問題がある。ネット上に、ロボットの行動データは存在しない。言語も画像も音声も、インターネットという既製の巨大データセットの上で進歩した。ロボットの行動データにはそれがない。NVIDIAが公開したSkild AIの導入事例は、実機で良質なデモを1本取るのに数分かかる一方、モデルの学習には数十億サンプルが要るという非対称性を、この分野最大のボトルネックとして挙げている。
この壁への打ち手は、大きく4つある。実機のテレオペレーション、大規模シミュレーション、人間の動画、そして視覚言語モデルが持つ世界知識だ。
ここで強調しておきたい。この4つは、どれか1つを選ぶ選択肢ではない。材料である。各社とも4つとも使っている。違うのは配合比だ。
Skild AIは、シミュレーションと人間動画を土台に置き、そこへ実機のテレオペレーションと実運用データを対象を絞って重ねる。グプタ氏はこれを「動画を見るだけでフェデラーになれるなら苦労はない。練習が要る」というテニスの比喩で説明する。Physical Intelligenceは逆に、実機データを太い土台に置き、そこへVLMの世界知識、人間動画、強化学習を重ねる。Google DeepMindは、巨大なマルチモーダルモデルの世界知識と推論能力を出発点にして、そこへ行動生成を接続する。
見落とされがちだが、ANYboticsもこの4つのうち2つを使っている。フランクハウザーCEOはTECHBLITZの取材(2024年)で、同社は当時すでに5年ほどAIを使っており、ロボットをプログラミングするのではなくシミュレーションで歩き方を自ら学習させ、それを実機に載せていると語っている。手法はSkild AIと重なる。違いは、その学習を汎用基盤モデルへ育てるのではなく、特定業務での信頼性に振り向けたことだ。
配合比の違いは、そのまま企業の経済構造になる。実機データは高価だが品質が高い。シミュレーションは無尽蔵に近いがsim-to-realのギャップが残る。人間動画は膨大だが、そこに関節トルクの正解は書かれていない。どこに重心を置くかは、開発コストとスピード、そして「何が得意なモデルになるか」を決める選択だ。報道が「現場のデータを学習させる」と一言で片付けるとき、この構造は完全に見えなくなる。