2026년 7월 업데이트
마커리스 모션 캡처 설명: 작동 방식
마커리스 모션 캡처는 AI와 컴퓨터 비전을 사용하여 일반 비디오를 3D 애니메이션 데이터로 변환합니다. 슈트, 마커 또는 센서가 필요하지 않습니다. 이 가이드는 2026년의 전체 파이프라인, 주요 AI 모델, 정확도 벤치마크, 최고의 도구 및 실제 응용 프로그램을 설명합니다.
마커리스 모션 캡처는 표준 비디오 영상에서 사람의 움직임을 기록하고 이를 3D 애니메이션 데이터로 변환하는 기술입니다. 반사 마커, 센서 슈트 또는 특수 카메라가 필요하지 않습니다. 컴퓨터 비전과 딥 러닝 모델을 사용하여 신체 관절을 감지하고 3D 포즈를 추론하며 게임, 영화, VR 및 로봇 공학에서 디지털 캐릭터를 구동할 수 있는 골격 애니메이션 데이터를 생성합니다.
2026년에는 마커리스 모션 캡처가 실험적인 연구에서 실용적인 제작 단계로 넘어갔습니다. QuickMagic, Move.ai, Plask 및 DeepMotion과 같은 도구를 사용하면 제작자는 휴대폰으로 녹화한 비디오를 업로드하고 몇 분 내에 깨끗한 FBX 또는 BVH 애니메이션 파일을 받을 수 있습니다. 이 가이드는 기술이 정확히 어떻게 작동하는지, 그 뒤에 있는 AI 모델, 장점과 한계를 설명합니다.
마커리스 모션 캡처란?
'마커리스'라는 용어는 공연자의 신체에 물리적 마커가 없다는 것을 의미합니다. 반사 점을 추적하는 대신 AI 모델은 픽셀 데이터에서 직접 해부학적 키포인트(어깨, 팔꿈치, 손목, 엉덩이, 무릎, 발목 등)를 식별합니다. 이러한 키포인트는 공연자의 움직임을 프레임별로 반영하는 디지털 골격을 형성합니다.
마커리스 모캡은 카메라 설정에 따라 세 가지 유형으로 나뉩니다:
| 유형 | 필요한 카메라 | 정확도 | 일반적인 사용 사례 |
|---|---|---|---|
| 단일 카메라 마커리스 | RGB 카메라 1대(휴대폰, 웹캠) | 보통 | 인디 게임, 소셜 미디어 콘텐츠, 프로토타이핑 |
| 다중 카메라 마커리스 | 동기화된 RGB 카메라 2~8대 | 높음 | 영화 VFX, 스포츠 분석, 연구 |
| 깊이 카메라 마커리스 | RGB-D 카메라 1대 이상(Kinect, RealSense) | 보통~높음 | VR/AR, 인터랙티브 설치, 임상 평가 |
마커리스 모션 캡처의 작동 방식: 5단계 파이프라인
1 비디오 입력 및 프레임 추출
프로세스는 표준 비디오 파일로 시작됩니다. 시스템은 비디오를 개별 프레임으로 압축 해제합니다. 일반적으로 초당 24, 30 또는 60프레임입니다. 각 프레임은 AI가 독립적으로 분석한 후 시간적 스무딩을 통해 연속적인 움직임으로 연결하는 정지 이미지입니다.
이 단계의 주요 고려 사항:
- 해상도: 더 높은 해상도(1080p 이상)는 포즈 추정기에 더 많은 픽셀 데이터를 제공하여 키포인트 정확도를 향상시킵니다.
- 프레임 속도: 더 빠른 프레임 속도는 모션 블러가 적은 빠른 움직임을 캡처합니다. QuickMagic는 다양한 제작 요구에 맞게 24/30/60/120 FPS 입력을 지원합니다.
- 조명: 고르고 확산된 조명이 가장 신뢰할 수 있는 결과를 생성합니다. 강한 그림자와 역광은 키포인트 감지를 혼란스럽게 할 수 있습니다.
- 카메라 안정성: 고정 카메라는 움직이는 카메라보다 더 깨끗한 데이터를 생성하지만, QuickMagic와 같은 고급 시스템은 글로벌 트래킹 모드로 움직이는 카메라 영상을 지원합니다.
2 2D 포즈 추정
이것이 핵심 AI 단계입니다. 딥 러닝 모델이 각 비디오 프레임을 분석하고 인체의 해부학적 키포인트의 2D 픽셀 좌표를 예측합니다. 모델은 다양한 포즈, 의복 및 환경에서 인간을 보여주는 수백만 개의 레이블이 지정된 이미지로 훈련되었습니다.
모델은 컨볼루션 신경망(CNN)을 통해 이미지를 처리합니다. 이 CNN은 신체 부위에 해당하는 시각적 패턴을 인식하는 방법을 학습했습니다. 각 키포인트(예: "왼쪽 팔꿈치")에 대해 모델은 해당 관절이 이미지에서 가장 가능성이 높은 위치를 나타내는 확률 히트맵을 출력합니다. 각 히트맵의 피크가 최종 2D 좌표가 됩니다.
모델별 일반적인 키포인트 수:
- MoveNet(Google): 17개 키포인트 — 주요 관절만 해당
- OpenPose(CMU): 25개 신체 키포인트 + 70개 얼굴 + 손당 21개
- MediaPipe BlazePose(Google): 손과 발을 포함한 33개 전신 키포인트
- HRNet(Microsoft): COCO 벤치마크에서 가장 높은 공개 정확도를 가진 17개 키포인트
다중 인원 감지를 위한 두 가지 아키텍처 접근 방식: 탑다운(먼저 각 사람을 감지한 다음 개별적으로 포즈 추정 — 더 정확하지만 더 느림) 및 바텀업(모든 신체 부위를 한 번에 감지한 다음 골격으로 그룹화 — 더 빠르지만 복잡한 장면에서 덜 정확함).
3 2D에서 3D로 리프팅
2D 키포인트가 감지된 후 시스템은 깊이, 즉 2D 이미지에 없는 Z축 정보를 추론해야 합니다. 이것은 마커리스 모캡에서 가장 기술적으로 어려운 단계입니다.
단일 2D 이미지는 깊이에 대해 본질적으로 모호합니다. 카메라를 향해 뻗은 팔은 옆으로 뻗은 팔과 비슷해 보입니다. 이를 해결하기 위해 3D 포즈 추정 모델은 두 가지 전략 중 하나를 사용합니다:
리프팅 기반 방법: 쌍을 이룬 2D-3D 모션 데이터로 훈련된 신경망이 2D 키포인트 시퀀스를 가져와 3D 공간으로 '리프팅'합니다. VideoPose3D 및 PoseFormer와 같은 모델은 시간 정보(여러 연속 프레임)를 사용하여 깊이를 명확히 합니다. 일반적인 정확도: 관절당 평균 위치 오차 35-45mm.
파라메트릭 바디 모델 피팅: 원시 3D 좌표를 예측하는 대신 시스템은 2D 관찰에 파라메트릭 인체 모델(가장 일반적으로 SMPL 또는 SMPL-X)을 피팅합니다. SMPL은 형태 매개변수와 포즈 매개변수로 신체를 정의합니다. 감지된 2D 키포인트와 일치하도록 이러한 매개변수를 최적화함으로써 시스템은 해부학적으로 올바른 관절 회전을 가진 일관된 3D 바디 메시를 생성합니다. 정확도: MHFormer 및 MixSTE와 같은 시간 모델의 경우 30-40mm.
다중 카메라 시스템은 삼각 측량을 사용하여 리프팅을 완전히 우회할 수 있습니다. 동일한 키포인트가 두 개 이상의 보정된 카메라 각도에서 보이는 경우 해당 3D 위치를 기하학적으로 계산할 수 있습니다. 이것이 연구용 마커리스 시스템(Theia3D, Anipose)이 마커 기반 모캡에 근접한 정확도를 달성하는 방법입니다.
4 골격 피팅 및 리타겟팅
3D 포즈 데이터(리프팅 또는 모델 피팅에서 얻은)는 일반적인 골격을 나타냅니다. 특정 3D 캐릭터를 구동하려면 이 데이터를 리타겟팅해야 합니다. 즉, 소스 골격의 비율에서 대상 캐릭터의 리그로 매핑해야 합니다.
리타겟팅에는 다음이 포함됩니다:
- 뼈 길이 스케일링: 캐릭터의 비율과 일치하도록 관절 간 거리 조정
- 회전 추출: 역운동학(IK)을 통해 3D 관절 위치를 관절 회전으로 변환
- 좌표계 정렬: 소스 골격의 기준 프레임을 캐릭터 리그의 예상 바인드 포즈와 일치
- 발 접촉 처리: 발이 땅에 닿는 시점을 감지하고 고정하여 발 미끄러짐 방지
QuickMagic와 같은 도구는 Mixamo, UE MetaHuman, Character Creator & iClone 및 Roblox를 포함한 캐릭터 리그 형식으로 직접 내보내기를 제공하여 이 단계를 자동화합니다.
5 정리 및 내보내기
마지막 단계는 시간적 스무딩을 적용하여 지터를 줄이고 일반적인 아티팩트(발 미끄러짐, 관절 튐, 상호 침투)를 수정하며 업계 표준 형식으로 애니메이션 데이터를 내보냅니다.
일반적인 정리 작업:
- 시간적 스무딩: 칼만 필터 또는 학습된 시간 모델이 프레임 간 지터를 줄입니다.
- 발 접촉 수정: 발-지면 접촉 프레임의 자동 감지 및 고정
- 침투 방지: 팔다리가 서로 통과하는 것을 방지하기 위해 관절 위치 조정
- 루프 및 트림: 원하는 시작/종료 프레임으로 애니메이션을 자르고 선택적으로 매끄러운 루프 생성
내보내기 형식 및 일반적인 사용 사례:
- FBX — Maya, Blender, 3ds Max, Unity, Unreal Engine을 위한 범용 교환 형식
- BVH — 모션 캡처 기본 형식, 애니메이션 도구에서 널리 지원됨
- BIP — Character Studio 워크플로우를 위한 3ds Max Biped 형식
- VMD — VTuber 및 MMD 콘텐츠를 위한 MikuMikuDance 형식
- UE MetaHuman — Unreal Engine 5 캐릭터 형식
- USD — Pixar가 개발한 3D 장면을 위한 새로운 표준
마커리스 모캡을 구동하는 AI 모델
2D 포즈 추정 모델
OpenPose(카네기 멜론 대학교)
실시간 다중 인원 2D 포즈 추정을 달성한 최초의 오픈 소스 프레임워크. 2017년에 출시되었으며, 부분 친화력 필드(PAF)를 사용하는 바텀업 접근 방식을 사용하여 신체 부위를 개인과 연결합니다. 25개의 신체 키포인트, 70개의 얼굴 랜드마크 및 손당 21개의 키포인트를 감지합니다. 연구 및 상업 파이프라인의 구성 요소로 널리 사용됩니다.
MediaPipe BlazePose(Google)
모바일 장치에서 실시간 성능을 위해 설계되었습니다. 중급 휴대폰에서 30FPS 이상으로 33개의 전신 키포인트를 추적합니다. 가벼운 아키텍처로 인해 많은 소비자용 피트니스, AR 및 아바타 앱의 백본이 되었습니다.
HRNet(Microsoft Research)
고해상도 네트워크는 저해상도 특징에서 복구하는 대신 네트워크 전체에서 고해상도 표현을 유지합니다. 이 설계는 HRNet에 COCO 키포인트 벤치마크에서 가장 높은 공개 정확도를 제공합니다. 연구용 3D 파이프라인에서 2D 감지 백본으로 일반적으로 사용됩니다.
ViTPose
여러 벤치마크에서 HRNet을 능가한 Vision Transformer 기반 포즈 추정기. 자기 주의 메커니즘을 사용하여 신체 전체의 글로벌 컨텍스트를 캡처하여 심한 자기 폐색이 있는 복잡한 포즈의 정확도를 향상시킵니다.
3D 포즈 및 바디 모델
SMPL(Skinned Multi-Person Linear)
막스 플랑크 지능 시스템 연구소에서 개발한 파라메트릭 바디 모델. SMPL은 10개의 형태 매개변수(신체 비율 제어)와 72개의 포즈 매개변수(24개 관절당 3개 회전)를 사용하여 인체를 나타냅니다. 이러한 매개변수가 주어지면 SMPL은 사실적인 피부 변형이 있는 전체 3D 메시를 출력합니다. SMPL은 최근 Epic Games(Meshcapade를 통해)에 인수되어 Unreal Engine과의 더 깊은 통합을 시사합니다.
SMPL-X
SMPL의 확장으로 손 관절(손당 15개 관절)과 얼굴 표정을 추가합니다. VTuber 아바타 및 디지털 휴먼과 같은 전신 + 손 + 얼굴 캡처가 필요한 응용 프로그램에서 사용됩니다.
VideoPose3D
2D 키포인트 시퀀스를 입력으로 받아 3D 키포인트 궤적을 출력하는 시간적 3D 포즈 추정 모델. 시간적 컨볼루션을 사용하여 모션 컨텍스트를 활용하여 깊이 추정 정확도를 향상시킵니다. 2D 감지만으로 작동하며 다중 카메라 설정이 필요하지 않습니다.
상업 도구가 이러한 모델을 결합하는 방법
QuickMagic와 같은 현대 마커리스 모캡 플랫폼은 단일 모델에 의존하지 않습니다. 대신 여러 특화 모델을 엔드투엔드 파이프라인으로 연결합니다:
- 사람 감지(YOLO 또는 유사) — 각 프레임에서 공연자를 식별하고 자릅니다.
- 2D 포즈 추정(맞춤형 HRNet 또는 ViTPose 변형) — 높은 정확도로 키포인트 감지
- 시간적 3D 리프팅(독점 시간 네트워크) — 2D 시퀀스를 3D로 변환
- 바디 모델 피팅(SMPL 또는 맞춤형 골격) — 일관된 관절 회전 생성
- 후처리(학습된 필터 + 규칙 기반 수정) — 지터 스무딩, 발 미끄러짐 수정
- 리타겟팅 및 내보내기 — 대상 리그 형식으로 매핑
이 다단계 접근 방식을 통해 상업 도구는 각 단계가 특정 작업에 최적화되고 제작 품질 모션 데이터로 훈련되기 때문에 단일 오픈 소스 모델만으로는 달성할 수 없는 더 높은 품질을 달성할 수 있습니다.
마커리스 대 마커 기반: 주요 차이점
| 비교 요소 | 마커 기반(광학) | 마커리스(AI/비전) |
|---|---|---|
| 필요한 하드웨어 | 적외선 카메라, 반사 마커, 슈트 | 표준 RGB 카메라(휴대폰, 웹캠, DSLR) |
| 설정 시간 | 1-4시간(보정, 마커 배치) | 1-5분(카메라 조준, 녹화) |
| 정확도 | 밀리미터 미만 위치, <1도 관절 각도 | 10-50mm 위치, 2-5도 관절 각도 |
| 비용 | $50,000-$250,000+ | $0-$50/월 |
| 휴대성 | 고정 스튜디오 설치 | 카메라가 있는 모든 곳 |
| 공연자 준비 | 슈트 피팅, 마커 보정 | 없음 — 일반 의류 착용 |
| 폐색 처리 | 신체에 가려진 마커는 손실됨 | AI 모델이 가려진 관절을 추론 가능 |
| 다중 인원 | 가능(충분한 카메라로) | 가능(단일 카메라로 1-2명) |
| 손/손가락 추적 | 가능(손 마커 세트로) | 가능(신체보다 덜 정확) |
| 실시간 미리보기 | 가능(저지연 시스템) | 가능(실시간 모델) |
| 최적 용도 | AAA 영화, 생체역학, 의료 | 인디 게임, 콘텐츠 제작, 프로토타이핑 |
관성(슈트 기반) 시스템을 포함한 더 깊은 비교는 다음 가이드를 참조하세요: AI 모션 캡처 대 전통적 모캡: 장단점.
마커리스 모션 캡처가 사용되는 곳
게임 개발
인디 및 중간 규모 게임 스튜디오는 마커리스 모캡을 사용하여 캐릭터 애니메이션(걷기 사이클, 전투 동작, 대기 동작, 컷신 퍼포먼스)을 모캡 하드웨어에 투자하지 않고 캡처합니다. 개발자는 휴대폰으로 참조 영상을 녹화하고, AI 모캡 도구로 처리하고, 10분 이내에 애니메이션 준비가 완료된 FBX 파일을 얻을 수 있습니다. QuickMagic는 Unreal Engine MetaHuman, Unity 및 Mixamo 리그로 직접 내보내기를 지원하여 리타겟팅 단계를 없앱니다.
AAA 스튜디오는 또한 광학 시스템의 보완재로 마커리스를 사용합니다: 프로토타이핑을 위한 빠른 참조 캡처, 사전 시각화를 위한 모션 스카우트, 주인공급 정밀도가 필요하지 않은 대량 배경 캐릭터 애니메이션.
영화 및 시각 효과
마커리스 모캡은 영화에서 두 가지 역할을 수행합니다: <



