[イーデイリーShin Yeong-bin 記者] 物流現場で素早く動く200種類以上の物品を、ロボットが人間のように5本の指で扱います。リアルワールドは、そのための次世代ロボット人工知能(AI)モデルの開発を加速させています。
リアルワールドのリュ・ジュンヒ代表は22日、ソウルCOEXで開催された「ヒューマノイド・サミット・ソウル2026」において、5本指のロボットハンドを産業現場に適用するための次世代精密操作技術と「リアルデックス(RLDX)-2」の開発方針を公開しました。
リアルワールドのリュ・ジュンヒ代表が22日、ソウル・COEXで開催された「ヒューマノイド・サミット・ソウル2026」で発表を行っています。(写真=Shin Yeong-bin 記者)
リュ代表が代表的な難題として挙げたのは、物流現場です。
同氏はCJ LOGISTICS(000120) の事例に言及し、実際の現場では実験環境よりもコンベアの速度がはるかに速く、扱うべき物品の種類も200種類を超えると説明しました。リアルワールドは、20以上の自由度(DoF)を備えた5本指のハンドを用いて、動く物体を把持・操作する技術を開発しています。
学習データからして、従来の方式とは一線を画しています。多くのロボット企業が、人がロボットを遠隔操作して作成するテレオペレーションデータや一人称視点の映像に依存しているのとは異なり、リアルワールドは、人が実際の現場で作業する動きそのものを直接データとして収集する方式を採用しました。
人の3次元(3D)の動きに時間情報を加え、触覚などの物理信号まで含めた、いわゆる「4D+データパイプライン」です。頭や体に装着する一人称視点カメラだけでなく、外部カメラも併用し、人が物体をどのように把持し、動かすかを精密に再現します。触覚情報を収集するための薄い手袋も準備しています。
リアルワールドは22日、ソウル・コエックスで開催された「ヒューマノイド・サミット・ソウル2026」で、ロボットハンドを活用した様々な物体の把持デモンストレーションを披露しました。(写真=Shin Yeong-bin 記者)
リュ代表は特に、既存のビジョン・言語・行動(VLA)モデルだけでは、産業現場が求めるレベルの精度を確保するのは難しいとの見解を示しました。工場では、大きな部品を掴んで運ぶだけでなく、小さなネジを掴んで正確な位置に組み立てる作業まで求められるからです。
同氏は、VLAには作業全体の計画や汎用的な動作の生成には強みがあるものの、こうした精密な作業には別途の技術が必要だと説明しました。これを受け、リアルワールドは物体の3D形状を再構成し、作業すべき位置を特定して手の動作を生成する技術を開発しています。
最終的には、一つの巨大なAIモデルがすべての処理を行う構造からも脱却します。人間のように全体的な行動を計画するVLAや、精密操作モデル、ワールドアクションモデルなどを同時に活用し、上位のAIが状況に応じて適切なモデルを選択する方式です。
リュ代表は、現在、大規模言語モデル(LLM)が、エージェントが複数のモデルやツールを選んで使用する方向へと進化していると述べ、ロボティクス・ファウンデーション・モデルも最終的には複数のモデルが連携して動く構造へと発展すると見通しました。同氏は、このようなアイデアをRLDX-2に反映させていると説明しました。
リュ代表は、「フィジカルAIは、科学的に優れたモデルを作るだけで終わってはならない」とし、「私たちは『現場導入優先』の研究所を目指し、実際の作業現場の問題を解決することに注力している」と述べました。
リアルワールドのリュ・ジュンヒ代表は22日、ソウルCOEXで開催された「ヒューマノイド・サミット・ソウル2026」において、5本指のロボットハンドを産業現場に適用するための次世代精密操作技術と「リアルデックス(RLDX)-2」の開発方針を公開しました。
リュ代表が代表的な難題として挙げたのは、物流現場です。
同氏はCJ LOGISTICS(000120) の事例に言及し、実際の現場では実験環境よりもコンベアの速度がはるかに速く、扱うべき物品の種類も200種類を超えると説明しました。リアルワールドは、20以上の自由度(DoF)を備えた5本指のハンドを用いて、動く物体を把持・操作する技術を開発しています。
人の動き・触覚まで丸ごと学習しますリアルワールドは、次世代モデル「RLDX-2」を準備しています。リュ代表は、既存の「RLDX-1」がオープンソースモデルと比較して高い性能を発揮していると述べ、学界や業界で急速に登場している新技術を「RLDX-2」に幅広く反映させていると説明しました。
学習データからして、従来の方式とは一線を画しています。多くのロボット企業が、人がロボットを遠隔操作して作成するテレオペレーションデータや一人称視点の映像に依存しているのとは異なり、リアルワールドは、人が実際の現場で作業する動きそのものを直接データとして収集する方式を採用しました。
人の3次元(3D)の動きに時間情報を加え、触覚などの物理信号まで含めた、いわゆる「4D+データパイプライン」です。頭や体に装着する一人称視点カメラだけでなく、外部カメラも併用し、人が物体をどのように把持し、動かすかを精密に再現します。触覚情報を収集するための薄い手袋も準備しています。
リュ代表は特に、既存のビジョン・言語・行動(VLA)モデルだけでは、産業現場が求めるレベルの精度を確保するのは難しいとの見解を示しました。工場では、大きな部品を掴んで運ぶだけでなく、小さなネジを掴んで正確な位置に組み立てる作業まで求められるからです。
同氏は、VLAには作業全体の計画や汎用的な動作の生成には強みがあるものの、こうした精密な作業には別途の技術が必要だと説明しました。これを受け、リアルワールドは物体の3D形状を再構成し、作業すべき位置を特定して手の動作を生成する技術を開発しています。
VLA一つではなく「複数の頭脳」で「4D+ワールドアクションモデル」もRLDX-2の主要な技術的方向性です。一般的なワールドモデルが過去の情報に基づいて将来の状態を予測するのに対し、リアルワールドは3D空間情報や触覚などの物理データを併せて受け取り、ロボットが取るべき行動そのものを生成するモデルを開発しています。
最終的には、一つの巨大なAIモデルがすべての処理を行う構造からも脱却します。人間のように全体的な行動を計画するVLAや、精密操作モデル、ワールドアクションモデルなどを同時に活用し、上位のAIが状況に応じて適切なモデルを選択する方式です。
リュ代表は、現在、大規模言語モデル(LLM)が、エージェントが複数のモデルやツールを選んで使用する方向へと進化していると述べ、ロボティクス・ファウンデーション・モデルも最終的には複数のモデルが連携して動く構造へと発展すると見通しました。同氏は、このようなアイデアをRLDX-2に反映させていると説明しました。
リュ代表は、「フィジカルAIは、科学的に優れたモデルを作るだけで終わってはならない」とし、「私たちは『現場導入優先』の研究所を目指し、実際の作業現場の問題を解決することに注力している」と述べました。