身體 + 手部追蹤合一:一次完成全身角色動畫
多數動作捕捉流程把一個人當成三個獨立問題來處理。身體走一套系統,手部走另一套,臉部再走第三套。然後有人花一個下午在時間軸上,設法讓三者彼此對齊。這篇文章要談的是如何完全跳過這一步——從一段普通影片中,一次同步捕捉身體、手部與臉部,並說明為什麼合併解算所產生的動畫,本質上比三層良好成果加總起來更好。
你將學到
分層動作捕捉的隱藏成本
傳統動作捕捉之所以模組化,是出於實際考量。光學系統能良好追蹤大型身體標記,但無法解析手指,因此外加了手套。臉部則需要頭戴式攝影機,因為臉部細節是以毫米為單位測量的。每個子系統在單獨運作時都非常出色,但也各自配備了記錄器、時鐘與坐標空間。
這種模組化背後的代價,多數人要到第一個專案結束後才會發現:
- 時間碼對齊。三個記錄裝置意味著三個時鐘。Genlock 有幫助,但消費級與準專業級設備在長時間拍攝中,通常會漂移一到兩個影格——足以讓一個彈指動作看起來明顯晚於產生它的手臂。
- 坐標空間不一致。手部資料是相對於手腕捕捉的,身體資料則是相對於臀部或世界原點。合併兩者需要一條轉換鏈,而任何誤差都會沿著手指關節向下累積。
- 分開的清理流程。你先去噪身體,再去噪手部,然後發現平滑設定不一致,手腕開始出現跳動。
- 合併勞務。在一般獨立製作專案中,合併與調和各層資料所花的時間,往往比實際動捕拍攝時數還多。
- 重拍的放大效應。如果某個子系統在拍攝中途失敗,你就得全部重拍,因為部分重拍的片段無法與你保留的圖層對齊。
這些都不是任何人的錯。這是這套架構按照設計運作的結果。但它意味著角色動畫真正的瓶頸從來不是「能不能捕捉動作」——而是「能不能讓同一人的三份捕捉結果彼此一致」。
表演者沒有分離的身體、手部與臉部時間軸。他們只有一個神經系統,產生一場協調的表演。你引入的每一條圖層界線,都是這份協調可能流失之處。
沒人警告過你的手腕接縫問題
這值得獨立一節,因為它是分層捕捉中最常見的瑕疵,而且最難向客戶解釋——他們看得出來哪裡不對,卻說不出名稱。
機制如下。你的身體解算會根據前臂與手掌平面的方向,產生一個手腕關節的旋轉值。你的手部解算也會從它自己對手掌的觀察,產生同一個手腕關節的旋轉值。兩者都是合理的估計,但它們幾乎從來不會完全相同。
合併時,你必須選一個,而無論選哪個都會製造問題:
採用身體解算的手腕
- 前臂到手的連接保持平滑
- 手指繼承了一個與它們被捕捉時不一致的手腕
- 抓握會偏離道具;手掌平面會以不易察覺的方式旋轉偏移
採用手部解算的手腕
- 手指與手掌的關係保持正確
- 前臂處會出現可見的旋轉不連續
- 快速動作時看起來像「壞掉的娃娃」在抽搐
工作室通常用混合區域來解決——在手腕與前臂下段之間,對兩種解算結果做權重混合。這有效,也需要技巧,而且每一顆鏡頭都要重新調整。混得太緊會出現跳動;混得太鬆,前臂旋轉會滲進手肘。
合併解算則直接繞過整個爭論。只有一個手腕旋轉值,因為從頭到尾只有一次解算。接縫不需要修補,因為它根本不存在。
合併解算真正做了哪些不同的事
很容易以為「合併捕捉」只是同時執行身體與手部模型,然後把輸出釘在一起。現代的AI 動作捕捉做的事情比這更有用。
一個骨架、一次最佳化
系統不是獨立解算身體與手部,而是將單一參數化人類模型——從髖部、脊椎、肩膀、手臂、手腕到每個手指關節的完整運動鏈——擬合到觀察到的影像證據上。關節角度是聯合估計的,受到「它們都屬於同一具身體」這個約束。沒有合併步驟,因為從來沒有分開過。
跨區域證據共享
這是真正提升品質的部分。當一隻手部分被遮擋時,關節解算仍可透過前臂方向、肩膀位置與身體姿勢來約束它——這是獨立手部模型根本無法取得的物理脈絡。反之,清晰可見的手指位置也有助於消解前臂滾轉的不確定性,這在僅靠身體標記估計時出了名地困難,因為前臂大致呈圓柱形。
共享的時間模型
對整個骨架執行一次平滑,代表身體與手部會以一致的方式被濾波。不會再發現手部看起來銳利、手臂卻遲鈍,或某個區域的抖動修正造成它相對於其他區域產生延遲。
以解剖學合理性作為約束
合併模型可以強制結果維持在「物理上可能的人類」範圍內——肢體長度保持恆定、關節保持在活動範圍內、手部以合理角度連接手臂。分層流程沒有機制可以在邊界上強制這點,這正是「不可能的手腕角度」之所以是分層捕捉常見瑕疵的原因。
取景的取捨——以及如何克服
這就是一次性捕捉背後最誠實的工程限制,也是多數教學因為不方便說而跳過的部分。
要捕捉身體,你需要整個表演者在畫面內。要捕捉手指,你需要足夠的手部畫素來解析各關節。這兩者互相拉扯。畫面拉廣以容納全身時,1080p 畫面中每隻手可能只佔 40×40 畫素——勉強夠模型定位 21 個地標點。畫面拉近對準手部時,身體就完全跑出畫面了。
這個取捨是真的,再多行銷話術也無法消滅它。但只要理解幾個槓桿,它就非常容易管理。
| 槓桿 | 建議 | 為什麼有效 |
|---|---|---|
| 拍攝解析度 | 即使最終交付 1080p,也拍 4K | 在相同取景下讓手部畫素變成四倍,是所有可做調整中影響最大的單一項目。 |
| 取景紀律 | 垂直填滿畫面;頭部接近上緣,腳部接近下緣 | 多數人站得太遠,浪費 40% 的畫面在天花板與地板上。 |
| 畫面比例 | 站立表演建議拍直立(9:16) | 站立的人又高又窄。直立取景浪費的畫素遠少於橫式。 |
| 鏡頭選擇 | 標準鏡頭、適中距離——避免超廣角 | 廣角鏡頭會引入桶狀變形,破壞深度估計,尤其在畫面邊緣。 |
| 手勢範圍 | 讓手保持在軀幹前方、遠離身體輪廓線 | 手部在自身衣物背景前形成剪影時,遠比手部重疊在胸口上更容易分割。 |
| 影格率 | 光線允許時使用 60fps | 每個影格的動態模糊較少。模糊會先破壞指尖等小特徵,遠早於影響軀幹追蹤。 |
| 燈光 | 胸部高度的寬廣正面光 | 手會移動到身體前方,脫離臉部高度的燈光範圍,正好在最重要時落進陰影。 |
只要先套用前三項——4K、緊湊直立取景、手部往前——通常就能從手機拍攝的全身畫面取得可用的手指細節。這就是全部訣竅。
使用 QuickMagic 一次捕捉全部動作
QuickMagic 是一個以瀏覽器為基礎的無標記動作捕捉平台,能從普通影片中一次性估計全身、手部與臉部動作,再轉換為可編輯的 3D 動畫資料。不需要動捕衣、不需要標記、不需要感應器、不需要多攝影機空間,也不需要在本機安裝任何東西。
關鍵比較:
分層流程
- 動捕衣或光學空間
- 獨立的手套硬體
- 頭戴式臉部攝影機
- 三段錄影要同步
- 合併、混合、修補手腕接縫
- 每顆鏡頭耗費數小時對帳
一次性 AI 捕捉
- 一台手機或網路攝影機
- 一個影片檔
- 身體、手部與臉部一起捕捉
- 輸出一個統一的骨架
- 沒有接縫需要混合
- 從上傳到匯出只需幾分鐘
免費方案確實可用於評估這是否適合你的流程,而且值得注意的是,合併捕捉本身並未被付費牆擋住:
| 免費方案 | 詳細內容 |
|---|---|
| 每月點數 | 50 V 幣,約可處理 50 秒影片,每月重置 |
| 追蹤範圍 | 身體、手部與臉部選項——合併捕捉包含在內 |
| 片段長度 | 每支影片最多 30 秒 |
| 上傳大小 | 50 MB |
| 匯出 | FBX——Blender、Unity、Unreal、Maya、3ds Max、MotionBuilder 均可讀取 |
| 儲存 | 15 天,請盡快下載並自行保留本地資料庫 |
付費方案則擴充額度與匯出矩陣。Basic($14.9/月、200 點、60 秒片段)解鎖 FBX、BIP、VMD、OnlyFace、C4D、BVH、Unreal、Mixamo、Unity Anim、CC & iClone 與 Roblox。Pro($49.9/月、1,000 點、90 秒片段、高佇列優先權)適合常態製作,Max 與 Studio 方案則服務持續大量執行的團隊。
逐步製作流程
完整的影片轉 3D 動畫流程,從頭到尾。第一次約需二十分鐘;之後每次只需三分鐘。
- 規劃表演錄影前先決定這顆鏡頭是否需要手指。如果需要,就要設計讓手勢保持在軀幹前方、避免手放背後或深度交疊的姿勢。花十秒鐘規劃,能省下一次重拍。
- 設定攝影機與燈光手機上腳架,位於胸部高度,直立方向,若有 4K/60 就開啟。胸部高度的寬廣柔光打在正面,有補光更好。背景單純。全身入鏡,上下盡量不要留多餘空間。
- 錄製頭尾緩衝開頭與結尾各保留兩秒自然 A-pose 或放鬆站姿。這能給解算器乾淨的初始化影格,也給你有乾淨的裁剪點。連續片段中多錄幾個 take,可以節省點數。
- 上傳前先裁剪只保留你需要的片段。計費是依處理秒數計算,因此確實裁剪等於直接放大方案能使用的量。
- 上傳並開啟所有追蹤把 MP4、MOV、AVI 或 WebM 丟進捕捉介面。明確同時開啟身體、手部與臉部追蹤。如果畫面中有多人,選取對象;設定影格率以符合目標流程,並依拍攝方式選擇靜態或移動攝影機模式。
- 批判性檢查預覽旋轉 3D 預覽並特別檢查三件事:手臂擺動時的手腕連續性、拍攝中最快瞬間的手指行為、以及走動時的腳部接觸。這三項會暴露大多數問題。
- 節制地套用清理使用平滑與姿勢控制移除殘餘抖動。不要過度平滑——這是最常見的自傷行為,會讓俐落的動作變成一團軟泥。修正明顯的 20%,其餘留給你的 DCC。
- 匯出到你的流程FBX 涵蓋 Blender、Unity、Unreal、Maya 與 3ds Max。VMD 可直接進 MikuMikuDance。BVH 相容性最高。Unreal 與 CC/iClone 預設可跳過轉換。
- 重定向並分層匯入、重定向到你的角色,然後在已烘焙動畫之上加上修正層,而不是直接編輯烘焙的關鍵影格。這樣日後想換入新的捕捉結果時,不必重做你的修正。
合併骨架的動作重定向
動作重定向是捕捉資料與實際角色相遇的地方。合併捕捉讓這件事既更容易、也稍微更要求——更容易,因為要對應的是一個一致且連貫的骨架;更要求,是因為這個骨架包含手指鏈,你的目標骨架也必須具備。
對應的是階層,而不只是肢體
新手對應了髖部、脊椎、手臂與腿,按下「重定向」,然後納悶手指為什麼是靜止的。合併捕捉每隻手帶有五條手指鏈——通常各有三個關節。你的對應必須包含全部。多數重定向工具會自動偵測標準命名;當沒有時,務必先精確對應拇指與食指,因為這兩指承擔了多數可感知的表情。
尊重休息姿勢
重定向品質高度依賴來源與目標是否具有可比較的休息姿勢。如果你的捕捉解算是 A-pose,而角色骨架是以 T-pose 建構,請明確設定校正,而不是期待工具自己猜。休息姿勢不一致,是「手部微妙旋轉偏移、卻沒人能確切診斷」的头号原因。
各流程注意事項
| 目標 | 路徑 | 注意事項 |
|---|---|---|
| Blender / Rigify | FBX 匯入,再用 Rokoko Live 或 Auto-Rig Pro 重新對應 | 骨頭捲動差異;設定一次對應預設後重複使用 |
| Unreal Engine / MetaHuman | Unreal 匯出預設或 FBX + IK Retargeter | MetaHuman 手指命名很特定;明確檢查拇指鏈 |
| Unity / Humanoid | FBX 搭配 Humanoid 骨架類型 | Unity 的 Avatar 對應會默默忽略未對應的手指——請檢查設定面板 |
| MikuMikuDance | 付費方案直接匯出 VMD | 幾乎不需要重定向;VMD 直接帶有原生日文骨頭名稱 |
| VRM 虛擬角色 | FBX,在 Blender 重定向後匯出 VRM | 標準化的人形骨頭讓這個流程在設定一次後就穩定可預期 |
| 風格化 / 非人形骨架 | 手動對應加上修正層 | 四指與手套型手部需要群組化指節對應 |
一次性捕捉在哪些情境最划算
合併捕捉並非在所有地方都同樣有價值。它在某些情境是革命性的,在其他情境則只是方便。釐清差異很重要:
VTuber 與虛擬表演
舞蹈翻跳、歌唱表演與短劇,都依賴身體與手部讀起來像是一場協調的表演。分層瑕疵在舞蹈中特別明顯,因為觀眾下意識知道真實動作看起來該是什麼樣。如果你特別關注手指表情,我們的 companion guide 深入探討了VTuber 手部追蹤的手勢庫與快捷鍵流程。
遊戲開發
獨立團隊在製作動畫集——待機、表情、互動動畫、武器操作——時,能獲得最戲劇性的時間節省。一個角色撿起物品的手勢需要身體與手指協調,用關鍵影格手key極其痛苦,用捕捉卻輕而易舉。
數位人類與虛擬製作
可信的數位人類成敗取決於手勢與言語之間的微觀協調。合併捕捉保留了手部強調動作與它強調的那個詞之間的自然時間關係——這種關係在分層流程中往往會被平移幾個影格,因而被破壞。這也正是即時身體追蹤流程常被用來餵養預視,之後再由更高品質的離線捕捉取代草稿動作的地方。
預視、分鏡與動態分鏡
速度比完美更重要。拍下你的意圖、捕捉它、放到代理角色上,十分鐘內你就有一個會動的動態分鏡。只針對通過審查的鏡頭做精修。
機器人與具身 AI 研究
來自合併捕捉的人類動作參考,可支援人形機器人模擬、模仿學習與行為原型開發。QuickMagic 提供 Unitree G1、H1 與 H1_2 平台的匯出預設——這說明了無標記動作捕捉現在已經延伸到多遠的領域,早已不只是娛樂。
用文字轉 3D 動畫補足缺口
不是每一顆鏡頭都值得拍攝。有時你需要背景角色做某件很普通的事,或者你希望在決定開拍前先測試五種動作變化,又或者動作需要你沒有的道具或身體能力。
文字轉 3D 動畫正好補上這個缺口。QuickMagic 的生成式 3D 動作功能,能把一段自然語言描述——例如「角色向前走、停下,然後張開手掌向左邊比劃」——轉換成可編輯的動作草稿,你可以像處理捕捉資料一樣預覽、匯出與精修。
用得好的話,兩種模式可以清楚分工:
- 捕捉那些「你的特定時間感、性格與身體感」才是重點的表演。
- 生成那些「一個合理的人在做出 X 動作」就完全足夠的銜接與背景動作。
- 疊代時先以生成起步,只拍攝通過剪輯審查的那個版本。
把生成的動作視為強而有力的初稿,而不是最終成果,它就會成為AI 3D 動畫流程中最有效率的工具之一。
比較:QuickMagic、Animate 3D、SayMotion 與其他工具
直接面對替代方案,比假裝它們不存在更有用。以下是主要選項在「合併身體加手部捕捉」上的具體比較。
| 工具 | 捕捉方式 | 合併身體 + 手部 | 免費方案 | 最適合 |
|---|---|---|---|---|
| QuickMagic | 單一影片捕捉加上文字轉動作,瀏覽器基礎 | 身體、手部與臉部一次完成;免費方案即包含 | 每月 50 點,FBX 匯出 | 想要無硬體全身角色捕捉的創作者與小團隊;原生 VMD 支援 MMD |
| DeepMotion Animate 3D | 影片轉 3D 動畫,瀏覽器基礎 | 有,手部追蹤在較高方案 | 有限的每月分鐘數 | 擁有物理選項與成熟 API 的既有平台 |
| SayMotion | 文字驅動的生成式 3D 動作 | 是生成而非從你的表演捕捉 | 有限的生成次數 | 以提示詞為基礎的動作創作、預視、快速發想 |
| Rokoko Vision | 單或雙攝影機影片動捕 | 身體表現強;免費網頁工具手部細節有限 | 有,但有條件 | 已經使用 Rokoko 硬體與外掛生態系的團隊 |
| Move AI | 多攝影機無標記捕捉 | 身體與手部都很強 | 沒有實質免費方案 | 有預算與空間架設多攝影機的工作室 |
| 光學 + 手套 | 硬體、分層子系統 | 最高真實度,但確實是分層 | 無 | 配備專職動捕人員的電影與 AAA 製作 |
公平總結:在重度交疊手指或密集道具接觸等極端案例中,硬體在原始真實度上仍然勝出;如果你能架設多台攝影機,Move AI 是無標記系統中的領先者。如果你只想要文字驅動生成,SayMotion 是為此而生的。Animate 3D 則是一個穩健、成熟的多用途選項。
QuickMagic 在這種使用案例上的具體優勢,是身體、手部與臉部捕捉在免費方案上即可一次完成,來自一段普通影片,並提供廣泛的匯出矩陣,包括 MikuMikuDance 的原生 VMD,以及文字轉 3D 動畫在同一個介面中。對於需要完整角色表演、而非只有身體骨架的創作者來說,這直接消除了本文開頭所說的那整套分層問題。
常見問題
QuickMagic 真的能從一段影片捕捉身體、手部與臉部嗎?
可以。身體、手部與臉部追蹤選項可以在同一次上傳中一起開啟,輸出一個統一的骨架。合併捕捉在免費方案上即可使用,不限於付費方案。
我需要多台攝影機嗎?
不需要。一台手機、網路攝影機或一般攝影機就足夠。多攝影機設定可以提升專業系統的真實度,但 QuickMagic 的無標記流程是為單一視角影片設計的。
因為攝影機取景以全身為主,手指細節會不會受影響?
確實有取捨,但可以管理。拍攝 4K、直立取景讓表演者填滿畫面、手保持在軀幹前方、胸部高度打光。做到這四項調整,全身取景通常仍能取得可用的手指細節。
這比分開捕捉身體與手部好在哪裡?
合併解算是在同一個骨架上、一次性估計所有關節,所以沒有時間碼漂移、沒有坐標空間不一致、也沒有需要混合的手腕接縫。身體脈絡也能幫助約束被遮擋的手指,手指位置則有助於解析前臂滾轉,因此精確度可能超過任何



