ヒューマノイドに電球の交換を依頼したところ、NVIDIAのフラッグシップAIは、何もしないロボットと同等の結果となった。
「Fiatlux」と呼ばれる新しいオープンベンチマークでは、Unitree G1ヒューマノイドロボットが、はしごを登り、天井の電球を交換するという一連の動作を連続して行う様子が評価されています。 NVIDIAのフラッグシップモデルであるGR00T N1.7は、統計的に「何もしない」というポリシーと同等のスコアしか記録できず、人間の専門家による遠隔操作でさえはしご登りのサブタスクを完了できなかったことから、真のボトルネックはAIの推論ではなく、全身制御にあることが示唆された。

ヒューマノイドロボットの前に、自立式のA型脚の踏み台を置きます。ロボットに、踏み台を登り、天井の照明器具から切れた電球をねじ外し、落とさずに持ち下ろし、新しい電球をねじ込み、再び降りてくるよう指示します。 有能な大人なら、訓練なしでも2分以内にこれをこなせる。今週arXivで公開されたベンチマークでは、ロボット業界で最高水準の公開基礎モデルにまさにこの課題を課したところ、そのモデルは、統計的には、コマンドを一切出さないポリシーと同等の結果となった。
これが本コラムの主張である。ヒューマノイド業界は、デモの見栄えの良さで進歩を測り続けているが、新たな公開ベンチマークは、真の限界が誰もが資金提供しているAIの「脳」にあるのではなく、その下にある「身体」にあることを明らかにしたのだ。 そのギャップを埋めた者はまだ誰もいない。最先端の視覚・言語・動作統合モデルでも、手作業でコーディングされたコントローラーでも、そしてさらに気まずいことに、同じロボットを遠隔操作する人間の専門家ですら、そのギャップを埋めることはできていない。
このベンチマークは「Fiatlux」と呼ばれ、5人の研究者(うち4人はハワイ大学マノア校に所属し、1人はパデュー大学と共同で研究を行っている)によって、NVIDIAのIsaac Labシミュレータ向けのネイティブ拡張機能として構築された。 その対象は「Unitree G1」だ。これは高さ1.3メートル、重量約35キログラムのヒューマノイドロボットで、Unitree社がすでに基本価格16,000米ドルで販売している。これはコンセプトロボットではない。今日でも注文できる実機であり、建物のメンテナンス作業員なら誰もが無意識のうちにこなしているタスクを実行する。
隠れたギャップを浮き彫りにするために構築されたテスト
ヒューマノイドのベンチマークの多くは、移動能力と操作能力を別々に評価しています。「HumanoidBench」は、61自由度の動作空間において15の全身操作タスクと12の移動タスクを評価しますが、各タスクは独立して実行されます。 一方、RoboCasaおよびその拡張版であるRoboCasa365は、150以上の物体カテゴリと100の評価タスクにわたるキッチンでの操作能力を評価していますが、登攀要素は一切含まれていません。どちらのシリーズも、ロボットに登攀中に壊れやすい物体を運ばせることを求めていないのは、
荷物を背負っての登攀は、荷物を背負っての歩行とは異なる制御上の課題である。Fiatluxはこれら2つを融合させている。1,440秒にわたる連続した1つのエピソードであり、12の原子的なサブタスクが順次実行される: はしごを所定の位置に移動させる、はしごを登る、古い電球を取り外す、それを持ちながら降りる、廃棄用クレートまで運ぶ、廃棄する、新しい電球に近づく、それを掴む、はしごまで運ぶ、それを持ちながら登る、ねじ込む、そして降りてくる。 ロボットの手は、50ニュートン以上の力で閉じると電球を押しつぶしてしまう仕様になっているため、このベンチマークは、機械が登るのに十分な強度を持ちつつ、同時に運んでいるものを壊さないほど繊細であるかどうかを、ひそかに検証しているとも言える。
この一文は、じっくりと噛みしめる価値がある。単一のシステムが、登るのに十分な強度を持ちつつ、同時に手にした物を壊さないほどの繊細さも兼ね備えていなければならないのだ。
ヒューマノイド投資家が皆、懸念すべき数値
NVIDIAのGR00T N1.7は、このようなベンチマークでテストするのに最適なモデルだ。2026年7月に一般提供が開始され、Apache 2.0ライセンスの下で公開されており、約2万時間分の自己中心視点の人間の動画に加え、両手操作ロボットやヒューマノイドロボットのデータセットを用いて学習されている。 どのような基準で評価しても、これは現時点でこの分野において、最も実績のある公開されている視覚・言語・動作統合モデルである。
Fiatluxの12のサブタスクに対してゼロショット評価を行ったところ、GR00T N1.7は加重スコア0.0876を記録した。すべての関節をデフォルトの位置に保持し、コマンドを発行しないベースラインポリシーは0.0861を記録した。 ランダムな動作をサンプリングするポリシーは0.0569を記録した。このフラッグシップモデルと「まったく何もしない」状態との差は、いずれのスコア自身の標準偏差よりも小さい。論文の著者らはこの比較を率直に述べている:GR00T N1.7は、ゼロアクションのベースラインと区別がつかない。
完了数はゼロ。低いというレベルではない。ゼロだ。12のサブタスクすべてにおいて、4つのランダム化されたレイアウトシードのそれぞれで、GR00T N1.7の実際の成功率は0.00であった。その加重スコアに見られるわずかな正の数値は
目標に近づいたことに対しては部分的な評価が与えられるが、目標を達成したことに対しては決して与えられない。人間もはしごを登れなかった
ここに、この物語の全体像を一新する発見がある。 研究者たちは、熟練した人間の遠隔操作も記録した。オペレーターはPICO 4ヘッドセットを装着し、全身コントローラーで脚部を操作しながら、逆運動学を用いてG1の腕を制御していた。登攀を伴わない8つのサブタスクにおいて、遠隔操作はほぼ毎回成功基準をクリアし、加重スコアは0.84であった。 一方、はしご登りを必要とする4つのサブタスク――はしごを登る、電球を持って降りる、新しい電球を持って登る、そして再び降りる――については、ベンチマークが定める成功基準を満たす遠隔操作の成功例は記録されていない。たった1件もなかったのだ。
人間であっても、完全な意図を持って同じハードウェアを直接制御したとしても、ベンチマークが定める安全範囲内で、この特定のロボットに壊れやすい物を運ばせながらA型はしごを確実に昇降させることはできなかった。これはAIの能力の問題ではない。 これはハードウェアおよび全身制御の問題であり、いくら優れた言語モデルの推論を用いても、それだけでは解決できない。
電球交換において最も難しかったのは、決して電球そのものではなかった。それははしごだったのだ。
ASEANのバイヤーがシミュレーション論文に関心を持つべき理由
私はこのプラットフォームに関するヒューマノイドベンダーのプレゼン資料を数多く目にしてきましたが、そのほとんどすべてが平地での作業に留まっています。倉庫でのピッキング、台本通りの挨拶、工場見学の案内などです。これは臆病さからではありません。「Fiatlux」こそが、その理由をかなり的確に説明しています。 マニラやジャカルタの施設管理担当バイヤーが、このベンチマークがシミュレートするまさにその種の作業――はしごを必要とする天井の照明器具のメンテナンス――のためにヒューマノイドを評価する場合、積載物を抱えた状態での全身を使った登攀を、次期製品サイクルで実装される機能としてではなく、未解決の課題として扱うべきだ。
だからといって、ヒューマノイドが「ベーパーウェア(実現しない製品)」だということにはならない。『Fiatlux』に含まれる8つの「登攀を伴わない」サブタスク――部屋内を移動し、物体を拾い上げ、運び、配置する――
正確に言えば、遠隔操作下では大幅に優れた性能を発揮し、現場の他の場所では自律制御ポリシーのもとで着実に性能が向上している。そのトレードオフは明確だ。平地での点検や仕分け作業についてはベンダーのロードマップを信頼しつつ、階段、はしご、足場への対応が「まもなく実現する」と示唆する提案については、ベンチマーク結果に基づいた厳しい質問を投げかけるべきである。この数値を実際に動かす要因
この業界では、より大規模なモデルが登場するのを待ち、スコアは自然と向上すると想定するのが常だ。Fiatluxは、その直感に真っ向から異議を唱えている。 事前学習済みの汎用ビジョン・言語・アクションモデルは、何も指示されていないロボットと同等の成績しか出せなかった。つまり、パラメータを増やしたり、動画の学習時間を増やしたりしただけでは、研究者自身の熟練パイロットでさえ手動では解決できなかった制御問題を、それ自体では解決できないということだ。欠けているのは言語理解ではない。 欠けているのは、多肢の接触遷移に特化して設計された全身制御システムだ。つまり、この論文が、資金調達の話題の大半を占める「視覚・言語・行動」スタックとは別の、独自の未解決の研究課題として扱っている、段から段への体重移動、重心の管理、把持力の制御といった要素である。
今後12ヶ月間には、過去12ヶ月間よりも多くのヒューマノイドのデモ動画が公開されるだろう。そのほとんどは、当然の理由から平らで転んでも大丈夫な床で撮影されるはずだ。注目すべき数字は、次の動画がどれほど洗練されているかではない。公開されたポリシー(自律型であれ遠隔操作型であれ)が、Fiatluxの4つの登攀サブタスクにおいて、ゼロではない明確な成功率を記録できるかどうかである。 コンピューティング業界で最も価値のある企業の1つが支援するApacheライセンスのモデルが、まったく何もしないロボットと互角の結果を出したばかりだ。その具体的な数値が変化しない限り、はしごの上にいるヒューマノイドを映した営業資料は、実力ではなく単なるパフォーマンスに過ぎない。
本分析は、公開日時点での一般に公開されている研究および製品情報を反映したものであり、投資、財務、または専門的なアドバイスとして解釈されるべきではありません。これは一般的な情報として提供されるものです。
あくまで参考用です。ヒーロー画像:Unitree G1ヒューマノイドロボット、公式製品写真、Unitree Robotics (unitree.com)。
