重要なお知らせ 「Forbes」の名称を使用した営業活動にご注意ください

製品

2026.10.06 08:56

ヒューマノイドの「カクカク動作」を人間の仕組みで解決、中国移動がオープンソース公開

Adobe Stock

Adobe Stock

ロボット全般、特にヒューマノイドロボットの動きは、大昔の映画やバッファリングが追いつかないYouTubeの動画のように、ブレたり、ぎこちなくなったりすることがある。中国の通信大手である中国移動(チャイナモバイル)は、この問題を解決する仕組みをオープンソースで公開した。これは「Open-RAIL」と呼ばれ、ロボットの「脳」であるAIモデルと「身体」の間の不一致を解消するものだ。

ロボットを制御するAIモデル、代表的には米エヌビディア(Nvidia)の「GR00T」やフィジカル・インテリジェンス(Physical Intelligence)の「π0(パイゼロ)」といった視覚・言語・行動モデル(VLA)は、動作が少し遅い場合がある。これらは周囲の状況を認識し、思考し、計画された一連の短い動作のまとまりである「アクションチャンク」を1秒間に約5〜10回出力する。しかし、ロボットのモーターは、1秒間に200〜1000回という頻度で新しい指令を必要とする。

そのギャップは30倍以上にもなる。

「既存の手法では、ロボットの動作実行においてジッター(小刻みなブレ)やストール(失速)、さらには一時停止が発生する。これは実現可能な実行速度を制限するだけでなく、タスク完了の全体的な成功率をも低下させる」と、中国移動の研究者らは論文に記している。

1秒間に5〜10回というのは速そうに思えるし、ある意味では実際に速い(事実、人間の脳も同程度の速度で動作している)。しかし、ロボットのCPUやGPUは、ロボットの身体を動かし、ビデオ、LiDAR(光による検知とレンジング)、オーディオを含む複数のセンサーからのデータを統合し、中央管理システムに接続するなど、多くの処理を同時に実行している。さらに、VLAは巨大なニューラルネットワークであり、たとえ先進的なチップと大容量のメモリを搭載していても、あらゆる計算に時間を要する。そのため、ロボットの身体がコマンドを実行し始め、次のコマンドを待ち、また動き、再び待つという動作を繰り返すと、結果としてぎこちなく不自然で、無駄の多い動きになってしまう。

実際、ロボットがお茶やコーヒーを注ぐような場合、動きがぎこちないと周囲を汚す可能性があり、危険を伴うことさえある。

現在とられている一般的な対策は、単に動作を遅くすることだ。

論文によると、多くのVLAのデモンストレーションでは、ジッターを隠すために動作速度を4分の1から8分の1に落としているという。一部のヒューマノイドロボットのデモ動画の隅に「2倍速」や「4倍速」といった表示があるのはそのためかもしれない。また、ヒューマノイドロボットの動きが予想よりも少し遅い傾向がある理由も、これで説明がつく。

この新しいオープンソースソフトウェアは、ロボットの身体が脳からの新しいコマンドを待つ必要がないようにすることで機能する。動作を3つの独立したスレッドに分割するのだ。すなわち、30Hz(1秒間に30回)の「観測」、5〜10Hzの「モデル推論」、そして200Hz〜1kHzの「モーター制御」である。これにより、ロボットが1つのアクションチャンクを実行している間に、モデルはすでに次のアクションチャンクの計算を進めることができる。その後、2段階のスムージング処理によって動作が補正される。まず各チャンク内の動きを滑らかにし、次に各動作チャンク間の継ぎ目をブレンドしてつなぎ合わせる。

その結果、無駄がなくシンプルでスムーズな、まるで人間のような動きが実現する。

これは、私たち人間の脳と身体が行っていることとほぼ同様である。筋肉は柔らかく弾力性があることで動きを滑らかにするが、それだけでなく、脊髄は脳に届く必要すらない素早い修正を処理し、脳は先を予測して、現在の動作が終わる前に次の動作を準備する。また、動作同士は重なり合う。Open-RAILが個別の動作間の継ぎ目をブレンドする2段階の処理のように、ある動作が完全に終わる直前に次の動作が始まる。たとえば、コップを掴む動作が完全に終わる前に、手を伸ばして持ち上げ始めるようなものだ。人間の脳もまた、Open-RAILのスムージングのように、動作の滑らかさを追求する仕組みを持っている。

その成果は有望に見える。

研究者らによると、このソフトウェアはぎこちなさを100分の1に低減したという。これは、マニュアル車を運転し始めたばかりの初心者と、高級車のオートマチックトランスミッションほどの違いがある。さらにOpen-RAILは、ロボットの動作速度を2倍以上に向上させ、タスクの成功率を10%から73%へと引き上げる。もちろん、これらは開発チーム自身が発表した数値であり、プロジェクトのウェブサイトにはタスクごとの詳細な内訳は記載されていない。第三者による再現性の検証が求められるが、このソフトウェアがオープンソースとして無償で公開されているため、それも間もなく行われるはずだ。

もちろん、他のアプローチでこの問題の解決に取り組んでいるケースもある。フィジカル・インテリジェンスは2025年に独自のリアルタイムチャンキング手法を発表しており、ハギングフェイス(Hugging Face)はそれを同社のオープンな「LeRobot」フレームワークに組み込んでいる。Open-RAILの論文では、このアプローチや、A2C2、VLASHといった他の学術的な手法とのベンチマーク比較を行っている。

しかし興味深いことに、Open-RAILは単一のアルゴリズムというよりも、40以上の実行時パラメータを公開するウェブコントロールパネルを備えたサーバー・クライアントシステムを含む、完全なデプロイメント層(展開層)として機能する。また、LeRobotのフォーマットでの自動データ記録や、ヒューマン・イン・ザ・ループ(人間介在型)の遠隔操作もサポートしており、オペレーターがタスクの途中でロボットを修正し、その修正内容をトレーニングデータにフィードバックすることができる。

開発チームによると、新しいモデルの追加に要するコードは50〜100行にすぎず、標準的なハードウェア抽象化レイヤーを使用することで、新しいロボットの導入にかかる期間は理論上「数週間から数時間」に短縮されるという。

現時点で対応しているモデルには、エヌビディアのGR00T、フィジカル・インテリジェンスのπ0(パイゼロ)およびπ0.5、ACT、RDT、SmolVLA、智元機器人(AgiBot)のGO-1、および中国移動独自のTAOモデルなどが含まれる。

サポート対象のロボットには、AgiBotの「G1」、NAVIAIの「WA2」、中国移動の「Lingxi(霊犀)」があり、プロジェクトのサイトには宇樹科技(Unitree)の「G1」もリストアップされている。

(forbes.com 原文)

タグ:

advertisement

ForbesBrandVoice

人気記事