AIモーションキャプチャ · ボディトラッキング
動くカメラからのボディトラッキング:AIが動的な映像をどう処理するか
実践ガイド:パフォーマーの動きとカメラの動きを分離し、ダイナミックなボディトラッキングを改善し、手持ちや追跡ショットを編集可能な3Dアニメーションに変換する方法。
移動カメラモーションキャプチャとは
移動カメラモーションキャプチャとは、カメラの位置、向き、焦点距離、またはそれらの組み合わせが変化するビデオに対して行われるマーカーレスモーションキャプチャです。 ソースは、手持ちのスマートフォンクリップ、ジンバルのフォローショット、台車移動、パンやチルト、ドローンショット、または徐々にズームする映像などです。
固定されたショットでは、背景はほぼ固定され、パフォーマーが可視的な動きのほとんどを生み出します。動的な映像では、被写体と視点の両方が動きます。そのためダイナミックなボディトラッキングは複合的な推論問題となります。AIは、カメラが画像をどう変化させるかを考慮しながら、体の関節ポーズを復元しなければなりません。
これは従来のスタジオモーションキャプチャとは異なります。光学システムは通常、マーカー、キャリブレーションされたカメラ、制御されたキャプチャボリュームを使用します。AIビデオモーションキャプチャは、通常のRGBビデオから動きを推定するため、既存の映像や軽量な制作環境がはるかに利用しやすくなります。その代償として、単一の映像は完全な深度情報を直接含まず、実際の映像にはぼけ、遮蔽、トリミング、視点の変化が含まれることがあります。
なぜ動的な映像がトラッキングしにくいのか
各フレームは、3Dシーンの2D投影を記録します。カメラが動くと、画面上の俳優の見かけの軌跡は、実際の世界での俳優の軌跡と同じではなくなります。
後ろ向きに歩きながら走者を撮影する場面を想像してください。走者はシーン内を速く移動していても、フレームの中央付近に留まるかもしれません。ポーズトラッカーは曲がった膝や振られる腕を識別できますが、信頼性のあるルート移動には、カメラの動き、スケール、地面との接触、時間経過にわたる動きのより広範な理解が必要です。
曖昧さの5つの原因
- カメラの並進と回転: パン、チルト、アーク、前進運動によりビュー全体がシフトします。
- 深度の曖昧さ: 単一のRGBカメラは距離を直接測定しないため、類似した2D画像を説明できる複数の3Dポーズが存在します。
- スケールの変化: カメラまたは被写体が近づいたり遠ざかったりすると、パフォーマーがフレーム内で大きくまたは小さくなります。
- モーションブラーとローリングシャッター: 高速な手持ち動画はランドマークをぼやけさせたり、直線運動を歪めたりします。
- 遮蔽とトリミング: 手足が交差したり、小道具が関節を隠したり、パフォーマーがフレームから外れたりすることがあります。
研究システムはこの問題を明確にしています。例えば、CVPR 2023のSLAHMRは、知覚されるカメラフレーム内の動きを人間とカメラの動きの合成として記述し、CVPR 2024のWHAMプロジェクトは、人間の動作証拠と推定されたカメラ角速度および足底接地を組み合わせて、世界に接地された軌道を復元します。3, 4 これらの論文はより広範な技術的方向性を示しています。商用システムは異なる独自アーキテクチャを使用する場合があります。
AIが動くカメラからのボディトラッキングをどう処理するか
単一の普遍的なパイプラインは存在しませんが、最新のシステムは通常、以下のいくつかの段階を組み合わせます。これらを連続したものとして考えると、エラーがどこから発生するかを理解しやすくなります。
パフォーマーを検出して追跡する
システムはまず各人物を特定し、フレーム間で一貫したIDを維持します。カメラがフレーミングを変えたり、パフォーマーが向きを変えたり、複数の人物が交差する場合に、安定したIDトラッキングが重要です。
可視の身体ランドマークを推定する
ポーズモデルは、腰、膝、足首、肩、肘、手首などの関節の証拠を特定します。これらは観測値であり、まだ最終的な3Dアニメーションではありません。
2Dの証拠を3Dポーズに持ち上げる
AIは、学習された体の比率、ポーズパターン、画像特徴、遠近法の手がかりを使用して深度を推測し、2Dフレームから3Dスケルトンまたはボディモデルを推定します。
時間を通じて推論する
時間モデルは、隣接するフレームや過去のフレームを比較します。これにより、動作の連続性を維持し、短いギャップを埋め、各フレームを無関係なポーズとして扱うことを回避します。妥当な歩行は、シーケンス全体を通じて妥当な歩行であり続けるべきです。
カメラの動きを推定する
一部のアプローチでは、背景特徴、オプティカルフロー、ビジュアルオドメトリ、またはSLAM(同時位置推定とマッピング)を使用して、視点がどのように変化するかを推測します。他のアプローチでは、カメラを考慮した動作を共同で学習します。目的は同じです。カメラによって引き起こされた動きを、パフォーマーに割り当てる前に説明することです。
ルートモーションと接地を解く
身体を一貫した座標系に配置し、ルート軌道を与えます。足底接地の推定は、足がいつ接地すべきかを決定するのに役立ち、ドリフトや足の滑りを減らします。
モーションを変換してリターゲットする
解かれたパフォーマンスは編集可能なスケルタルアニメーションになります。その後、キャラクターリグにマッピングし、3Dパッケージやゲームエンジンでレビューおよび調整できます。
AIビデオモーションキャプチャにおける固定カメラ vs 移動カメラ
| 要素 | 固定カメラ | 移動カメラ |
|---|---|---|
| トラッキングの難易度 | 背景と視点が安定しているため低い。 | カメラと人間の動きを分離する必要があるため高い。 |
| 創造的自由度 | 制御されたキャプチャと繰り返し可能なフレーミングに最適。 | フォローショット、シネマティックなブロッキング、スポーツ、アーカイブ映像に適している。 |
| ルート軌道 | 画像空間の移動から推測しやすい。 | より強力なカメラ認識と時間的推論が必要。 |
| よくあるアーティファクト | ポーズのジッター、深度エラー、足の滑り。 | これらに加え、ドリフト、スケール変化、誤った進行方向。 |
| 最適な選択 | キャプチャ品質と迅速なクリーンアップが優先される場合。 | アクションや既存の映像に変化する視点が必要な場合。 |
移動カメラが自動的に悪い入力というわけではありません。パフォーマーがはっきり見えるスムーズな追跡ショットは、深刻な遮蔽、悪い照明、強いぼけがある固定カメラのビューよりも解決しやすい場合があります。入力品質は単一の設定ではなく、複合的な要素です。
より良い移動カメラモーションキャプチャ映像を撮影する方法
AIは多くの実世界の条件を補うことができますが、フレームに到達しない視覚的証拠を復元することはできません。これらの撮影上の選択により、モデルにより強力な情報が与えられ、後でのアニメーションクリーンアップが軽減されます。
- 全身がはっきり見えるようにする。 全身キャプチャの場合は、頭、手、足を含め、パフォーマーの周りに小さな余裕を持たせます。
- カメラをスムーズかつ意図的に動かす。 ジンバルは役立ちますが必須ではありません。可能な限り、急なウィップパンや方向転換の繰り返しは避けます。
- 鮮明な露出のために十分な光を使用する。 良好な照明はより速いシャッターを可能にし、手や足の周りのモーションブラーを減らします。
- 背景の詳細を保持する。 完全に特徴のない壁、反射面、または強くぼけた背景は、カメラモーションの証拠が弱くなります。
- 長い遮蔽を避ける。 短い手足の交差は普通ですが、小道具や他の人物の後ろに体の大部分が何フレームも隠れるのは困難です。
- 積極的なズームを制限する。 緩やかな焦点距離の変化は、カメラの並進と組み合わされた急速なズームよりも解釈しやすいです。
- 被写体を読み取れる大きさに保つ。 遠くのパフォーマーは、信頼性のある手、足、関節角度にはピクセルが少なすぎる場合があります。
- クリーンなアクションウィンドウを記録する。 俳優に明確な開始ポーズを与え、完全な動きをキャプチャし、パフォーマンスの前後に短いバッファを残します。
- 関節構造を隠すゆったりした衣服を避ける。 明確な手足のシルエットは、肘、膝、腰の向きを読み取るのに役立ちます。
- 最終的なフレームレートを早期に決定する。 一貫したソースと出力のフレームレートにより、エクスポートおよびリターゲット中の不要なタイミング変換が減ります。
QuickMagic での移動カメラワークフロー
QuickMagic AI Body Tracking は、スマートフォン、ウェブカメラ、またはカメラからの適切な映像を、モーションキャプチャスーツ、マーカー、深度ハードウェア、マルチカメラスタジオなしで編集可能な3Dボディモーションに変換します。公式ワークフローには、固定カメラモードと移動カメラモードに加え、全身、上半身、対応するマルチ被写体オプションが含まれています。1
- ソースクリップを確認する。 体の可視性、ぼけ、遮蔽、被写体の重なり、ショットが固定カメラか移動カメラかを確認します。
- ビデオをアップロードする。 スマートフォン、ウェブカメラ、DSLR、または標準的なカメラで記録された対応ソースを使用します。
- 適切なトラッキング設定を選択する。 パフォーマー、全身または上半身の処理、フレームレート、カメラモード、利用可能なクリーンアップ設定を選択します。
- モーションを生成してプレビューする。 1フレームだけで判断するのではなく、関節の動作、体の方向、グローバルな移動、重要な接地を検査します。
- 可視エラーを修正する。 サポートされている場合、トラッキングの問題を修正し、キャラクターがルート移動を保持するかその場で動くかを決定します。
- 出力先にエクスポートする。 対象ワークフローに応じて利用可能なフォーマットまたはプリセットを選択します。QuickMagic は、Blender、Unreal Engine、Unity、Maya、3ds Max、MotionBuilder、Cascadeur、iClone、MMD、Robloxなどのツール向けにFBXやワークフロー固有のオプションをリストしています。利用可能性はプランとワークフローによって異なります。1
- リターゲットして仕上げる。 リグ付きキャラクターにモーションを適用し、必要に応じて足の接地、ルートモーション、ジッター、手の配置、メッシュ交差をクリーンアップします。2
最も有用な品質チェックは、並行レビューです。ソースのパフォーマー、トラッキングされたスケルトン、リターゲットされたキャラクターを同時に比較します。これにより、キャプチャエラーと、プロポーションの不一致や関節の向きなどのリターゲット問題を分離できます。
よくある移動カメラトラッキングの問題とその修正方法
| 問題 | 考えられる原因 | 試すこと |
|---|---|---|
| 足が床の上を滑る | ルート移動、地面の高さ、深度、接地タイミングの誤った推定。 | 移動カメラモードを見直し、可視の足を維持し、リターゲット後にフットロックとルートモーションを調整する。 |
| 体がドリフトまたは方向転換する | カメラの動きがパフォーマーの移動として解釈された。 | 正しいカメラ設定を使用し、クリップをクリーンなアクション部分に短くし、急なカメラ変更を避ける。 |
| ターン中に手足がスナップする | 自己遮蔽、ぼけ、または曖昧なシルエット。 | より明確なテイクを選び、光を追加し、カメラの動きを遅くする、または影響を受けるキーフレームを修正する。 |
| ショットが進むにつれてスケールが脈動する | 急速なズーム、強い深度変化、またはシーンの手がかりの不足。 | 速いズームを避け、テクスチャのある背景の詳細を保持し、俳優の体を読み取り可能に保つ。 |
| パフォーマー間でIDが入れ替わる | 長時間の重なり、類似した外見、またはフレームの出入り。 | 長期にわたる交差を減らし、分離を維持し、エクスポート前に被写体選択を見直す。 |
| リターゲットされたキャラクターがおかしく見える | リグマッピング、休止ポーズ、関節軸、または体のプロポーションが一致しない。 | キャプチャしたモーションを変更する前に、エクスポートプリセットとリターゲットマッピングを確認する。 |
いつ移動カメラを使用すべきか?
移動カメラの映像は、固定ショットでは得られない情報や創造的価値を提供する場合に使用します。空間内を走るランナーを追跡する、



