ロボティクスのためのホリスティックAIトラッキング:人間の参照動作データ

ヒューマノイドロボットに動き方を教える能力——各関節の軌道を手作業でコード化するのではなく、人間の動きを見せることで教える——は、現代ロボティクスにおける最も重要な変革の一つです。この変革の中心にあるのが人間の参照動作データです。これは、ロボットの制御ポリシー(方策)の学習信号となる、人間の動きの高忠実度な記録です。そして、このデータの大規模な収集を可能にする技術こそ、ホリスティックAIトラッキングです。

本記事では、ホリスティックトラッキングがロボティクスにとって何を意味するのか、AIを活用したモーションキャプチャがどのようにしてロボット対応の参照データを生成するのか、そしてQuickMagicのようなプラットフォームが、Unitree(ユニツリー)のヒューマノイドロボットなどを扱う研究者やエンジニアにこのパイプラインをどのように提供しているのかを解説します。

ロボティクスにおけるホリスティックトラッキングとは

ホリスティックトラッキングとは、人間の被写体の完全な動き——すべての関節、すべての手足、すべての指、そして空間内での身体の軌跡——を捉え、それをロボットが学習できる構造化データに変換することを指します。ここで「ホリスティック(全体的)」という言葉が重要な意味を持ちます。従来のモーションキャプチャシステムは、しばしば一つの側面に焦点を当てていました。つまり、手を含まない全身の骨格トラッキング、身体のコンテキストを伴わない手のトラッキング、あるいは単独の表情キャプチャなどです。ホリスティックトラッキングは、これらすべてを同時に捉え、人間の動きを自然に見せる身体各部の関係性を保持します。

ロボティクスにとって、この完全性は贅沢品ではありません。それは必須条件です。ロボットがコップに水を注ぐことを学習するとき、体幹の傾き、腕のリーチ、指が取っ手を握る動作、そして足を通じた体重移動——これらすべてを同時に把握する必要があります。部分的なデータは部分的な行動しか生みません。ホリスティックなデータは、一貫性のある全身スキルを生み出します。

ロボティクスのためのホリスティックトラッキングの主要な構成要素は次のとおりです。

  • 全身骨格トラッキング:頭部、体幹、腕、脚、足など、すべての主要な身体セグメントの関節角度と位置を3D骨格アニメーションとして再構築します。
  • 手と指のトラッキング:個々の指の関節角度、手首の回転、握りの形成——操作タスクや器用な把持に不可欠です。
  • グローバル軌跡トラッキング:相対的な関節運動だけでなく、時間経過に伴う身体のワールド空間内での位置と向きを追跡します。これはロボットに、手足がどのように配置されているかだけでなく、部屋のどこにいるかを伝えるものです。
  • 時間的一貫性:学習アルゴリズムを混乱させるような突然のジャンプやジッターがなく、滑らかで物理的に妥当なフレームごとの動きです。

人間の参照動作データがロボットにとって重要な理由

ロボットは人間と同じようには動き方を学習しません。人間の幼児は、試行錯誤と模倣を通じて運動制御を発達させるのに何年もかかります。一方、ロボットは通常、強化学習(RL)を通じて学習します。これは、シミュレーション内で何千もの動きを試し、成功したものには報酬を受け取り、感覚入力からモータコマンドへのマッピングを行う制御ポリシーを徐々に開発するプロセスです。

問題は、ゼロからの強化学習が非常にコストのかかるものだということです。可能な動きの探索空間は天文学的な広さです。ガイダンスがなければ、ロボットは歩くことに膝を曲げることが必要だと発見するために数百万回のシミュレーションエピソードを費やすかもしれません。それは、人間の幼児が他人を観察することで理解することです。

ここで、ロボット用モーションキャプチャ参照データが状況を一変させます。ロボットはゼロから学習する代わりに、人間の動きを参照信号——追跡すべき目標として与えられます。RLポリシーは、直立を維持することだけでなく、参照動作に可能な限り近づくことに対しても報酬を得ます。これにより、探索空間は劇的に狭まります。ロボットは歩行を発明する必要はありません。人間の歩行を自分の身体に適応させる必要があるのです。

研究により、参照動作に導かれた強化学習がゼロからの学習よりも劇的に優れた結果を生み出すことが一貫して示されています。画期的なBeyondMimicフレームワークとその後継は、ヒューマノイドロボットがリターゲットされた人間のモーションデータを追跡することで、武術、ダンス、アクロバティックな宙返りを含む複雑でダイナミックな動きを学習できることを実証しました。より最近のOmniTrack(CVPR 2025)のような研究は、物理的に整合性のある参照データにより、Unitree G1が側転や宙返りを行い、1時間以上連続して走ることができることを示しました。

重要な洞察:人間の参照動作データは単なる学習入力ではありません。それはロボットの学習を実現可能にする制約です。「このように動け」とロボットに指示することで、不可能なほど大きな探索問題を扱いやすいものに変換するのです。

人間の動きからロボットの動きへ:リターゲティングパイプライン

人間の動きをキャプチャすることは、最初のステップにすぎません。人間とロボットは根本的に異なる身体を持っています。人間の骨格には、特定の可動域、体重分布、アクチュエータ強度を持つ200以上の関節があります。Unitree G1は構成に応じて23〜43の自由度を持ちます。Unitree H1は27です。人間からキャプチャされたモーションデータは、ロボットに直接適用することはできません。リターゲティングが必要です。

リターゲティングとは、人間の関節運動をロボットの運動学的構造にマッピングするプロセスです。これには以下が含まれます。

  1. 身体のマッチング:人間のどの関節がロボットのどの関節に対応するかを特定します。人間の肩はロボットの肩に対応しますが、人間の3自由度の肩甲骨運動はロボットの2自由度の肩に対応する場合があり、単純化が必要です。
  2. スケーリングと比率の調整:人間の腕はUnitree G1の腕よりも長いです。四肢の長さは、動きがロボットの形状に合うようにスケーリングする必要があります。
  3. 関節限界の強制:人間の股関節の回転がロボットの物理的限界を超える場合、不可能なコマンドを防ぐために、リターゲティングされた動きをクランプまたは調整する必要があります。
  4. 足底接触の処理:人間の足は特定のパターンで地面に着地します。リターゲティングされた動きは、ロボットの足が地面と適切に接触すること(浮遊なし、貫通なし)を保証する必要があります。
  5. 貫通防止補正:四肢が互いに、またはロボット自身の身体を通過してはなりません。高品質なリターゲティングには、衝突検出と補正が含まれます。

2025年と2026年に発表された研究は、リターゲティングの品質がポリシーの性能を直接決定することを明確にしています。「Retargeting Matters: General Motion Retargeting for Humanoid Motion Tracking」(Stanford HAI, 2025) という研究では、PHC、ProtoMotions、およびGMRと呼ばれる新しい方法の3つのリターゲティング手法を比較し、リターゲティングデータ内のアーティファクト(地面貫通、自己交差、突然の関節ジャンプ)が学習されたポリシーの堅牢性を著しく低下させることを発見しました。場合によっては、リターゲティングが不十分だと、ロボットがその動きをまったく学習できないことさえありました。

これが、Unitree G1、H1、H1_2などの特定のロボットモデルに人間の動きをマッピングするリターゲティングを自動的に処理するプラットフォームが多大な価値を提供する理由です。それらは、研究者のワークフローから複雑でエラーが発生しやすいステップを取り除き、シミュレーション環境で即座に使用できるデータを生成します。

従来のモーションキャプチャ vs. AI搭載のマーカーレスキャプチャ

何十年もの間、モーションキャプチャのゴールドスタンダードは光学式マーカーベースのシステムでした。つまり、特定の身体ランドマークに配置された反射マーカーを、管理されたスタジオ内の校正済み赤外線カメラのアレイで追跡するものです。OptiTrackやViconなどのシステムは、サブミリ精度を提供しますが、大きな制限もあります。

要素従来の光学式モーションキャプチャAIマーカーレスモーションキャプチャ
必要なハードウェア複数の校正済みカメラ、反射マーカー、取り付けリグ単一カメラ(スマートフォン、ウェブカメラ、またはプロフェッショナルカメラ)
環境固定設置の管理されたスタジオ屋内、屋外、実験室などあらゆる場所
セットアップ時間校正に30分以上1分未満——アップロードして処理するだけ
被写体の準備マーカースーツまたは身体への粘着マーカーマーカー不要、スーツ不要、特別な服装も不要
動作の自由度キャプチャボリュームに限定無制限——カメラで見える場所ならどこでもキャプチャ可能
拡張性通常、1つのキャプチャボリュームで一度に1人の被写体クラウド処理によりバッチキャプチャと処理が可能
コストフルシステムで50,000〜250,000ドル以上無料または低コストのサブスクリプション
精度サブミリ精度(グラウンドトゥルースに最適)センチメートルレベル(ほとんどのトレーニングデータに十分)

トレードオフは明らかです。従来のシステムは生の精度で優れています。AIマーカーレスシステムは、アクセシビリティ、拡張性、コストで優れています。ロボティクス研究——その目標が単一キャプチャでのベンチマークレベルの精度を達成することではなく、大規模で多様なトレーニングデータセットを生成することであることが多い——においては、AI搭載キャプチャの利点が決定的です。

汎用の移動ポリシーを訓練するために100種類の異なる歩行スタイルが必要な研究チームは、100人の被験者をモーションキャプチャスタジオに連れて行くことは現実的にはできません。しかし、スマートフォンで100本のビデオを録画し、マーカーレスプラットフォームにアップロードし、それぞれについてリターゲティングされたロボットモーションデータを受け取ることはできます。これは、UnitreeモーションキャプチャAIワークフローが可能にする種類の拡張性です。

Unitreeロボット統合:人間の動きからG1、H1、H1_2へ

Unitree Roboticsは、学術研究と産業研究の両方で最も広く使用されているヒューマノイドロボットプラットフォームの一つとして浮上しました。Unitree G1——身長132cm、重量約35kg、構成に応じて23〜43の自由度——は、2025年だけでCaltech、SJTU、HKU、コーネル大学などの機関から30以上の査読付き論文が発表された二足歩行研究のリファレンスプラットフォームとなっています。Unitree H1およびH1_2——身長180cmのフルサイズのヒューマノイド——は、全身操作とダイナミックな移動タスクに使用されています。

AIモーションキャプチャとUnitreeロボットの統合には、特定のパイプラインが必要です。

1. キャプチャ

人間の動きは、スマートフォン、ウェブカメラ、プロフェッショナルカメラなど、あらゆるカメラソースを使用してビデオとして録画されます。重要な要件は、被写体がはっきり見えること、適切な照明、そして少なくとも30 FPSのフレームレート(速い動きには60 FPS以上が推奨されます)です。

2. AI処理

ビデオは、身体のランドマークをフレームごとに検出し、3D骨格アニメーションを再構築し、貫通防止補正を適用して動きが物理的に妥当であることを保証するAIモデルによって処理されます。出力は、BVHやFBXなどの標準形式の全身モーションシーケンスです。

3. ロボットの運動学へのリターゲティング

人間の動きは、特定のUnitreeモデルの運動学的構造にリターゲティングされます。例えば、Unitree G1の29自由度のEDU構成は、H1の27自由度の構造とは異なる関節限界と四肢の比率を持っています。リターゲティングプロセスは、人間の動きをこれらの制約に適合するようにスケーリングし、ロボットが物理的に達成可能な関節角度軌道を生成します。

4. ロボット互換形式でのエクスポート

リターゲティングされた動きは、ロボットシミュレーションおよびトレーニングフレームワークで直接使用できる形式でエクスポートされます。QuickMagicのUniRobotエクスポートプリセットはこのステップを処理し、Isaac Gym、MuJoCo、Unitree RL GYMで使用するためのUnitree G1、H1、H1_2仕様に対応したデータを生成します。

5. トレーニングと展開

リターゲティングされた参照動作は、RLベースの動作模倣の追跡ターゲットとして機能します。ポリシーは、バランスを維持し、ロボットの物理的ダイナミクスを尊重しながら、参照に可能な限り忠実に従うことを学習します。トレーニング完了後、ポリシーはUnitree SDKを介して物理ロボットに展開できます。

このパイプライン——ビデオキャプチャからロボット展開まで——は、現在では従来のモーションキャプチャハードウェアなしで完了できます。Unitree G1、スマートフォンカメラ、ブラウザベースのAIモーションキャプチャプラットフォームを持つ研究者は、トレーニングデータを生成し、シミュレーションを実行し、物理ロボットにポリシーを展開できます。

応用:ホリスティックトラッキングとロボット学習の融合

模倣学習

模倣学習(行動クローニングとも呼ばれます)は、ロボットに実証された行動を再現するように訓練します。ホリスティックな人間のモーションデータがそのデモンストレーションを提供します。ヒューマノイドロボットにとって、これは何をするか(コップを拾う)だけでなく、人間らしい動作の質でどのように行うか——体重移動、リーチ軌道、握りの形成——を学習することを意味します。ホリスティックデータ(身体+手+軌跡)の豊かさは、身体のみのデータよりも自然で一般化可能な行動を生み出します。

参照追跡を用いた強化学習

RLベースの動作模倣では、ロボットのポリシーは物理的安定性を維持しながら参照動作を追跡するように訓練されます。参照動作は報酬信号として機能します。ロボットの動きが参照に近いほど、報酬が高くなります。このアプローチは、BeyondMimic、OmniTrack、OmniH2Oなど複数のフレームワークと複数のロボットプラットフォームにわたって検証されており、ゼロからのRLよりも一貫して堅牢で自然なポリシーを生み出しています。

行動プロトタイピング

数時間から数日かかる可能性のある本格的なRLトレーニングランに着手する前に、研究者は参照動作データを使用して行動をプロトタイピングできます。ロボットの運動学的構造はこの動きをサポートできるか?関節限界違反はあるか?この動きは動的に安定するか?最初にシミュレーションで参照データをテストすることにより、研究者は実行不可能な動きを早期に除外し、成功の可能性が高い動きにトレーニングリソースを集中できます。

テレオペレーションとヒューマン・イン・ザ・ループ制御

リアルタイムの人間の動きトラッキングにより、テレオペレーションが可能になります。オペレーターの動きがキャプチャされ、リアルタイムでロボットにマッピングされ、複雑なタスクのロボットを直接制御できます。TWIST2(2025)のようなシステムは、VRベースの全身テレオペレーションが20分以内に100件の両腕操作デモンストレーションをほぼ100%の成功率で収集できることを実証しました。これは、手動のロボットプログラミングでは不可能なデータ収集効率です。

スキルライブラリの構築

ロボティクスが汎用ヒューマノイドプラットフォームに向かうにつれて、再利用可能な動作スキルのライブラリを構築・維持する能力が重要になります。ホリスティックトラッキングにより、歩行、走行、しゃがみ、リーチ、把持、投げるなど、多様な人間の動きを体系的にキャプチャし、カタログ化し、異なるロボットモデルにリターゲティングし、トレーニングや直接展開のためにオンデマンドで取得できます。

データ品質:ロボットトレーニングに適した参照動作の条件

すべてのモーションデータがロボット学習に等しく役立つわけではありません。参照データの品質は、学習されたポリシーの品質に直接影響します。最近のロボティクス研究の知見に基づくと、以下の品質基準が重要です。

  • 物理的妥当性:動きは物理的な身体によって達成可能でなければなりません——浮遊なし、地面貫通なし、自己交差なし。物理的に一貫性のない参照データは、RLポリシーに動きの学習と不可能な物理の補正を同時に強制し、性能を低下させます。
  • 関節限界の遵守:リターゲティングされたデータ内のすべての関節角度は、ロボットの機械的可動域内に収まる必要があります。限界を超える関節値は、トレーニング中にNaNエラーや不安定な動作を引き起こします。
  • 時間的滑らかさ:関節角度の突然のジャンプ——単一フレームの不連続性であっても——RLトレーニングに不安定性をもたらします。モーションデータは、ジッターを除去するためにフィルタリングし、欠落フレームを補間する必要があります。
  • 足底接触の正確さ:移動タスクでは、足底接触のタイミングと位置が正確でなければなりません。足のスケーティング(接地すべきときに足が滑ること)は、移動ポリシーの品質を低下させる最も一般的なアーティファクトの一つです。
  • 多様性:単一の歩行スタイルで訓練されたポリシーは、そのスタイルしか生成しません。異なる速度、異なる地形、異なる移動タイプなど、多様な参照データでのトレーニングは、新しい状況に適応できる汎用ポリシーを生み出します。

AIモーションキャプチャプラットフォームは、これらの基準のいくつかを自動的に処理します。貫通防止システムは、四肢が互いを通過することを防ぎます。リターゲティングプリセットは関節限界を強制します。クラウドベースの処理により、多様なモーションセットのバッチキャプチャが可能になります。しかし、人間の研究者も依然として品質保証の役割を果たします。トレーニングランに着手する前に、シミュレーションでリターゲティングされた動きをプレビューします。

身体性ギャップとその橋渡し

完璧なモーションキャプチャと完璧なリターゲティングがあっても、根本的な課題が残ります。身体性ギャップ(エンボディメントギャップ)です。人間とロボットは同じではありません。人間の重心はUnitree G1のものとは異なります。人間の筋肉は電動モーターとは異なる方法で力を生み出します。人間の関節はロボットの関節とは異なる減衰特性を持っています。

ロボットに「この人間の動きを追跡せよ」と指示するとき、あなたは暗黙のうちに、その身体が設計されていないことを要求しています。これは以下を引き起こす可能性があります。

  • 浮遊:参照動作が、ロボットの重量が地面にいるべきと示しているのに、ロボットを空中に配置します。
  • 貫通:リターゲティングされた関節角度により、ロボットの四肢が身体や床を切り抜けます。
  • 足のスケーティング:人間の歩行パターンがロボットの歩幅と一致しないため、ロボットの足が滑ります。

最近の研究は、物理的に一貫性のある参照生成によってこのギャップに対処しています。例えば、OmniTrackフレームワーク(CVPR 2025)は2段階のアプローチを使用します。まず、特権情報を持つポリシーが、物理シミュレーター内でロボットが人間の動きを現実的にどのように実行するかを「想像」し、人間のオリジナルに似ているがロボットの物理に従う動きを生成します。次に、第2段階のポリシーが、固有受容データ(ロボットが実際に感知できるもの)のみを使用して、この物理的に一貫性のある参照を追跡することを学習します。この分離——「この動きは物理的に可能か?」と「ロボットはそれに追従できるか?」を切り離すこと——は、Unitree G1が側転宙返り、側転を行い、屋外で60分間連続して走る