인체는 마커리스, 물체는 고정밀: AI와 광학 모션 캡처를 결합해야 하는 이유
전문 현장에는 한 사람만 있는 경우가 드뭅니다. 로봇, 도구, 헤드셋, 소품, 훈련 장비와 카메라가 함께 작업을 구성합니다. AI는 자연스러운 인체를, 광학 시스템은 핵심 강체를 맡고, 둘을 같은 좌표계와 시간축에 놓는 방식이 더 현실적입니다.

핵심 관점: 전문 현장에는 한 사람만 있는 경우가 드뭅니다. 로봇, 도구, 헤드셋, 소품, 훈련 장비와 카메라가 함께 작업을 구성합니다. AI가 자연스러운 인체를 담당하고, 광학 시스템이 핵심 강체를 담당하게 한 뒤, 둘을 같은 좌표계와 시간축에 놓는 방식은 “순수 AI가 모든 것을 해결한다”는 접근보다 훨씬 더 현실적으로 배포할 수 있는 경로입니다.
1. “사람을 본다”는 것이 곧 “작업을 이해한다”는 뜻은 아닌 이유
시연자가 손을 뻗고, 허리를 굽히고, 몸을 돌릴 때 인체 골격은 관절과 신체 분절의 변화를 설명할 수 있습니다. 하지만 그가 어떤 도구를 들고 있는지, 도구의 방향이 어떤지, 목표물과 접촉했는지, 로봇 엔드 이펙터가 따라오는지 알 수 없다면, 시스템은 “사람이 어떻게 움직였는가”만 답할 수 있고 “작업이 어떻게 완료되었는가”는 답할 수 없습니다. 로봇 모방 학습, 시뮬레이션 훈련, LBE, 가상 제작에서는 작업 결과가 보통 사람과 물체의 관계에 의해 결정됩니다.
AI 마커리스 모션 캡처는 대량의 학습 샘플에서 인체 구조를 인식하는 데 강점이 있어, 사람은 마커를 붙이거나 센서를 착용하지 않고도 자연스럽게 움직일 수 있습니다. 광학 마커 방식은 마커 부착 단계가 추가되지만, 형태가 명확한 강체에 직접적이고 식별 가능한 광학 특징을 제공합니다. Semcam Live + Goku 하이브리드 모션 캡처는 이 두 방식의 장점을 바탕으로, 같은 장면 안의 사람과 물체를 공통 좌표계에서 실시간으로 혼합 캡처할 수 있게 합니다.
2. 순수 마커리스 방식에서 가장 쉽게 간과되는 세 가지 경계
첫 번째는 객체의 경계입니다. 업계 홍보에서는 흔히 “인체에는 마커가 필요 없다”를 “현장에는 어떤 마커도 필요 없다”로 단순화합니다. 실제로 도구, 소품, 장비 같은 물체는 일반적인 인체 자세 모델만으로 6자유도 포즈를 얻을 수 없습니다. 프로젝트가 물체 캡처에 밀리미터 수준 또는 그보다 더 엄격한 정밀도를 요구한다면, 현재 실현 가능한 방식은 여전히 광학 캡처입니다.
두 번째는 정체성의 경계입니다. 여러 사람이 교차하고 비슷한 소품이 동시에 나타날 때, 시스템은 “여기에 사람 또는 물체가 있다”를 감지하는 것뿐 아니라 시간에 따라 정체성을 유지해야 합니다. 인체 ReID는 외형과 움직임의 연속성을 활용할 수 있고, 강체 마커 클러스터는 기하학적 배치를 통해 객체를 식별할 수 있습니다.
세 번째는 평가의 경계입니다. 인체 동작의 오차는 보통 키포인트 거리, 관절각 차이, 궤적 유사도 또는 작업 분류 정확도로 표현됩니다. 물체, 즉 강체는 보통 위치 좌표와 공간 자세로 표현됩니다.
3. 우리의 하이브리드 아키텍처가 실제로 하는 일
Semcam Live 다중 카메라는 먼저 카메라 단에서 인체 검출, 세그멘테이션, 2D 키포인트, ReID와 신뢰도를 추출하고, Active Center는 카메라 간 매칭, 삼각측량, 3D 키포인트, 골격 해석과 출력을 수행합니다. Goku 광학 시스템은 로봇, 도구, 소품, 컨트롤러, 카메라, 훈련 장비 등의 강체 추적에 사용됩니다. 두 종류의 데이터는 Active Center 안에서 통일된 좌표계, 시간축, 프로젝트 관리를 사용합니다. 여기서 “통일”은 적어도 세 가지 층위를 포함합니다. 기하학적 통일은 사람과 물체의 위치를 같은 공간에서 비교할 수 있음을 뜻합니다. 시간적 통일은 한 프레임의 손동작이 같은 순간의 도구 자세와 대응된다는 뜻입니다. 프로젝트 통일은 데이터 명명, 재생, 내보내기를 여러 소프트웨어에서 반복적으로 맞출 필요가 없다는 뜻입니다. 이 세 가지가 모두 성립해야 팀은 사람-물체 거리, 접촉 이벤트, 동작 단계, 협업 관계를 안정적으로 계산할 수 있습니다.
4. 로봇: “사람의 자세를 모방”하는 것에서 “사람과 물체의 관계를 재현”하는 것으로
휴머노이드 로봇 데이터 수집은 흔히 인체 관절을 로봇 관절에 매핑하는 일로 단순화됩니다. 하지만 인체와 로봇은 골격 비율, 자유도, 관절 한계, 질량 분포, 충돌 제약이 다르기 때문에 인체 골격을 안전한 제어 명령으로 바로 사용할 수 없습니다. 데이터는 좌표 변환, 리타게팅, 제약, 평활화, 접촉 판단, 안전 전략을 거쳐야 합니다. MuJoCo는 로봇공학, 생체역학, 머신러닝을 위한 범용 물리 엔진으로 자리 잡고 있으며, NVIDIA Isaac Sim은 ROS 2를 통해 로봇 애플리케이션과 시뮬레이션을 연결합니다. 이 데이터 흐름에서 강체 데이터는 시연이 작업 의미를 갖는지를 결정합니다. 예를 들어 “렌치를 집어 볼트를 조인다”는 작업에서 인체 손 궤적은 동작 형태만 설명합니다. 렌치 포즈는 잡기와 회전을 설명하고, 대상 부품 포즈는 도구가 올바른 위치에 도달했는지를 설명하며, 로봇 상태는 재현이 성공했는지를 설명합니다. 이 데이터가 서로 다른 시스템에서 오고 시계와 좌표가 일치하지 않으면, 많은 수작업 정렬이 데이터 생산성을 떨어뜨립니다.
Semcam Live + Goku가 우선 증명하려는 것은 화려한 실시간 원격 조작만이 아니라 감사 가능한 데이터 패키지입니다. 인체 골격, 손 키포인트, 도구 6DoF, 로봇 말단, 타임스탬프, 좌표 정의, 품질 라벨, ROS/MuJoCo/Isaac으로 가져오는 예시가 포함됩니다.
5. LBE와 시뮬레이션 훈련: 신체 존재감뿐 아니라 소품과 절차도 필요합니다
LBE VR에서 헤드셋과 컨트롤러는 보통 머리와 양손 위치를 제공할 수 있지만, 플레이어는 가상 세계에서 자신의 전체 몸을 보지 못하거나 동료의 자연스러운 동작을 보기 어려울 수 있습니다. Semcam Live 마커리스 모션 캡처는 인체 움직임을 실시간으로 캡처하여, 기존 광학 캡처에서 허리와 발 등에 Tracker를 착용해야 하는 부담을 줄이고 매장 운영 효율을 높입니다. Goku는 헤드셋, 컨트롤러, 무기, 소품, 인터랙티브 장치 등의 물체를 추적합니다. 두 시스템은 Active Center에서 통합 관리됩니다.
시뮬레이션 훈련은 절차 증거를 더 중요하게 봅니다. 인체만 보면 훈련생이 허리를 굽혔는지, 손을 들었는지는 알 수 있지만, 올바른 장비를 선택했는지, 밸브가 제 위치까지 회전했는지, 들것이 수평을 유지했는지, 두 사람이 동기화되어 협업했는지는 알 수 없습니다. Semcam Live + Goku 시스템이 결합되면 강체 궤적과 인체 동작이 함께 연결되어 “동작—객체—작업 노드” 복기가 가능해집니다.
6. 결론: 전문성은 한 가지 기술을 고집하는 것이 아니라 결과에 책임지는 것입니다
Semcam Live 마커리스 인체 캡처의 가치는 자연스러움, 속도, 지속 가능성에 있습니다. Goku 광학 캡처가 물체, 즉 강체에 제공하는 가치는 높은 확실성의 포즈입니다. 이 둘을 같은 좌표계와 시간축에 놓으면 사람과 로봇, 도구, 소품, 장비의 관계를 더 완전하게 기록할 수 있습니다. 이것은 Semcam Live가 일반적인 비디오 모션 캡처와 구별되는 중요한 방향이며, 로봇 훈련, LBE VR, 시뮬레이션 훈련 분야에서의 핵심 강점입니다.