정보로 돌아가기제품 출시

공간이 사람의 움직임을 이해하게 하다: 엣지 AI가 모션 캡처를 바꾸는 방식

엣지 AI는 TOPS 숫자 추가가 아니라 계산 재배치입니다. 카메라가 먼저 화면을 이해하고, 중심이 공간을 재구성합니다.

2026.08.296 MIN
출시:Semcam Live
공유:
공간이 사람의 움직임을 이해하게 하다: 엣지 AI가 모션 캡처를 바꾸는 방식

핵심 관점: 엣지 AI는 카메라 사양표에 TOPS 숫자를 하나 더하는 것이 아니라, 모션 캡처의 계산을 다시 배분하는 것입니다. 카메라가 먼저 화면을 이해하고, 중심이 다시 공간을 재구성합니다. 이는 다중 영상 중앙 처리의 부담을 낮추고, 현장 피드백 경로를 줄이며, 로컬 제어를 강화할 수 있지만, 동기화, 버전, 장비 운영 유지에 대한 새로운 요구도 가져옵니다.

1. 다중 카메라 시스템이 “모든 영상을 한 대의 컴퓨터로 보내는 것”에만 의존할 수 없는 이유

모션 캡처 공간이 커지면 카메라 수, 해상도, 프레임레이트, 인원 수가 모두 증가합니다. 각 카메라가 완전한 고화질 영상을 한 서버로 계속 집중 전송하면, 중앙은 디코딩, 인체 검출, 분할, 키포인트, 신원 매칭, 3D 재구성을 동시에 담당해야 하며, 네트워크와 GPU 부담은 규모에 따라 증가합니다. 서버를 단순히 늘리면 일부 문제는 해결할 수 있지만 배선, 장비실, 전력 소비, 유지보수, 단일 장애점 위험도 함께 늘어납니다.

엣지 컴퓨팅의 기본 사고는 처리의 일부를 데이터가 생성되는 곳 가까이에 배치하는 것입니다. NIST SP 500-325는 기존 클라우드 IoT 시스템이 규모, 이질성, 높은 지연에 직면할 수 있으며, 애플리케이션과 분석을 네트워크 내부에 분산하는 것이 포그/엣지 컴퓨팅의 중요한 가치라고 지적합니다.[1] 모션 캡처에서 “가까운 곳”은 카메라 내부, 공간 가장자리의 서버, 또는 로컬 센터일 수 있습니다. 서로 다른 계층이 서로 다른 작업을 맡으면 시스템은 모든 픽셀을 원격으로 옮긴 뒤에야 이해를 시작할 필요가 없습니다.

흔한 오해는 피해야 합니다. 엣지 AI는 중심이 전혀 없다는 뜻이 아닙니다. 단일 카메라는 2D 화면을 볼 수 있지만 통일된 공간 안의 완전한 3D 인체를 독립적으로 얻을 수는 없습니다. 다중 카메라에는 여전히 캘리브레이션, 시간 정렬, 시점 간 신원 매칭, 삼각측량이 필요합니다. 진짜 아키텍처 문제는 어떤 작업이 분산에 적합한지, 어떤 작업은 집중되어야 하는지, 그리고 분산된 결과의 일관성을 어떻게 유지하는지입니다.

2. 우리가 카메라 쪽에 배치한 것

Semcam Live에서 카메라 측은 인체 검출, 추적, 분할, 2D 키포인트, ReID, 신뢰도 계산을 수행하고, Active Center는 카메라 간 매칭, 삼각측량, 3D 키포인트, 골격 솔빙, IK, 필터링, 리타게팅을 완료합니다.[2][3] PRO, PRO+, ULTRA는 각각 40, 55, 100 TOPS로 표기되며, 단일 장비 소비전력은 10, 15, 18W입니다.[2] 이는 현재 공개 사양입니다. 우리는 TOPS를 모델 정확도, 처리량, 또는 엔드투엔드 성능으로 직접 해석하지 않습니다. 우선 이론적 연산 등급을 반영합니다.

카메라 쪽이 먼저 구조화된 결과를 추출하면, 이론적으로 중앙이 각 영상 스트림을 반복 처리하는 부담을 줄이고, 같은 프레임의 검출, 키포인트, 신뢰도를 프레임 번호와 묶을 수 있습니다. 중앙은 다중 시점 관계와 3D 솔빙에 더 집중합니다. 이런 분업은 고정 공간 확장에 적합합니다. 실제로 몇 대의 카메라까지 확장 가능한지, 네트워크에는 어떤 대역폭이 필요한지, 중앙 하드웨어는 어떻게 구성해야 하는지, 카메라 모델 업그레이드가 동기화되는지는 구체적인 프로젝트와 해당 기술 문서로 확인해야 합니다.

엣지 AI는 장애 위치 파악도 바꿉니다. 중앙 집중 시스템에서 문제가 생기면 사용자는 최종 골격 이상만 볼 수 있습니다. 계층형 시스템은 특정 카메라의 노출 이상, 특정 시점의 키포인트 신뢰도 하락, 카메라 간 매칭 충돌, 삼각측량 관측 부족을 확인할 수 있습니다. 전제는 소프트웨어가 실제로 사용자에게 진단 정보를 노출하는 것입니다. 따라서 우리는 정상 화면만이 아니라 시스템이 “문제를 어떻게 발견하는지”도 보여줄 것입니다.

3. 변화 1: 실시간을 데모가 아니라 품질 관리로 만들기

실시간 모션 캡처는 캐릭터가 즉시 움직이는 것으로 포장되는 경우가 많지만, 연구, 로봇, 훈련 공간에서 실시간의 첫 번째 가치는 무효 수집을 피하는 것입니다. 운영자는 동작이 끝나기 전에 인체가 화면 밖으로 나갔는지, 핵심 관절이 가려졌는지, 여러 사람의 신원이 바뀌었는지, 도구가 사라졌는지, 외부 장비가 동기화되었는지 알아야 합니다. 모든 문제가 수집 후에야 발견된다면, 연속 수집이 빠를수록 폐기 데이터도 많아질 수 있습니다.

현재 공개된 정보에 따르면 Semcam Live는 120fps 실시간 출력과 100ms 미만의 엔드투엔드 지연을 지원합니다.[2][3] 이 수치는 테스트 경계와 함께 이해해야 합니다. 카메라 노출부터 시작하는지, 네트워크, 중앙 솔빙, 프로토콜 전송, 대상 애플리케이션 렌더링을 포함하는지, 그리고 카메라 수, 인원 수, 골격 복잡도, 하드웨어 구성을 함께 설명해야 합니다. 구체적인 프로젝트는 실제 링크 테스트를 기준으로 합니다.

실시간 링크가 신뢰도와 상태를 동시에 출력할 수 있다면, 현장 애플리케이션은 품질 임계값을 설정할 수 있습니다. 핵심 관절의 낮은 신뢰도가 지속되면 동작 조정을 안내하고, 특정 카메라가 오프라인이면 공식 시도를 일시 중지하며, 다중 인원 신원이 불안정하면 재촬영 태그를 추가합니다. 이러한 규칙은 Active Center와 산업 애플리케이션이 공동으로 구현해야 하며, 근거 없이 이미 갖추었다고 주장할 수 없습니다. 홍보에 적합한 방식은 실제 “데이터 품질 검사 워크플로”를 공개하고 각 알림의 출처와 조치를 명확히 쓰는 것입니다.

4. 변화 2: 카메라 수와 공간 커버리지를 더 쉽게 확장하기

중앙 집중 아키텍처를 확장할 때 카메라 추가는 영상 대역폭, 디코딩, 추론 작업의 추가를 의미합니다. 엣지 아키텍처에서 카메라를 추가하면 카메라 자체가 추론의 일부를 맡고, 중앙은 더 간결한 구조화 결과를 받습니다. 이론적으로 이는 커버리지 면적과 시점 중복성을 확대하는 데 유리합니다. 우리는 ULTRA를 12명과 최대 45미터의 대공간 용도로도 계획하고 있습니다.[2] 그러나 “아키텍처가 확장 가능하다”와 “제품이 45미터, 12명 현장에서 이미 안정적으로 운행되었다”는 서로 다른 주장입니다.

확장은 선형적으로 무료가 아닙니다. 카메라가 많아지면 캘리브레이션 복잡도, 시점 간 매칭 조합, 스위치 포트, PoE 예산, 클록 동기화, 현장 유지보수가 증가합니다. 구조화 데이터 자체도 인원 수, 키포인트 수, 프레임레이트에 따라 증가합니다. 엣지 장비에는 온도, 전력, 펌웨어, 모델 일관성 요구가 있습니다. 일부 카메라가 서로 다른 버전으로 실행되면 출력에 체계적 차이가 나타날 수 있습니다.

따라서 우리는 규모화 구성 가이드를 단계적으로 보완할 것입니다. 일반적인 공간별 카메라 수, 시야 중첩 계획, 스위치와 케이블 요구사항, 중앙 구성, 허용 카메라 거리, 캘리브레이션 점검 빈도, 장시간 운행 테스트, 장애 복구가 포함됩니다. ULTRA는 현재도 “출시 예정” 상태이며, 관련 대공간 지표는 사전 공개 정보로 설명하고 실제 프로젝트에서 공간 평면도와 운행 기록으로 검증할 것입니다.

5. 변화 3: 데이터 경계를 더 제어 가능하게 하지만 자동으로 안전해지는 것은 아님

동작 영상에는 얼굴, 신체 특징, 건강 상태, 업무 흐름, 공간 정보가 포함될 수 있습니다. 로봇 시연은 공개되지 않은 제품과 공정을 포함할 수도 있습니다. 클라우드 서비스는 계약, 암호화, 컴플라이언스 체계로 안전하게 운영될 수 있지만, 모든 조직이 원본 영상을 기본적으로 외부에 보내려는 것은 아닙니다. NIST SP 800-144는 조직이 데이터, 애플리케이션, 인프라를 퍼블릭 클라우드에 외주화할 때 관련 보안과 개인정보 문제를 평가할 것을 권고합니다.[4]

우리는 완전한 로컬 배포를 채택합니다. 실시간 재구성, HPE, 프로젝트 관리, 내보내기는 모두 로컬에서 완료할 수 있습니다. 카메라 측 처리 후에는 키포인트, 신뢰도 등 구조화 데이터가 전송됩니다.[2][3] 이는 고객에게 더 직접적인 데이터 경계를 제공합니다. 내부망에서 운행하고, 프로젝트 요구에 따라 영상 보존과 외부 접근을 관리할 수 있습니다. 그러나 로컬 시스템에도 계정, 권한, 로그, 백업, 패치, 디스크 암호화, 물리 보안이 필요합니다.

엣지 AI는 새로운 거버넌스 문제도 가져옵니다. 모델은 업데이트가 필요할 수 있으며, 업데이트 패키지가 어디에서 오는지, 서명되었는지, 오프라인에서 가능한지, 출력을 바꾸는지 확인해야 합니다. 카메라가 화면을 캐시하는지, 장비 고장 반송 시 데이터가 포함되는지, 로그가 인원 정보를 기록하는지도 제품 보안 문서에 들어가야 합니다. 브랜드 마케팅이 “로컬”을 클라우드에 대한 두려움으로만 표현하면 객관성을 잃습니다. 더 신뢰할 수 있는 표현은 고객이 작업에 따라 로컬, 프라이빗 클라우드, 하이브리드 방식을 선택하게 하고 책임 경계를 명확히 하는 것입니다.

6. 변화 4: 영상을 전송하는 것에서 “의미가 있는 데이터”를 전송하는 것으로

영상은 풍부하지만 무거운 원시 증거이고, 키포인트와 골격은 가볍지만 모델이 해석한 구조화 결과입니다. 엣지 AI는 시스템이 수집端에서 의미화를 시작하게 합니다. 이 사람이 누구인지, 어떤 픽셀이 그에게 속하는지, 관절이 어디에 있는지, 신뢰도는 어떤지입니다. 중앙은 여러 시점을 다시 3D로 융합합니다. 이런 데이터는 ROS 2, 엔진, 또는 Python 애플리케이션으로 실시간 진입하기 쉽습니다.

ROS 2의 Topic은 센서 데이터, 로봇 상태 등 연속 데이터 스트림을 위해 설계되었으며,[5] 실시간 골격과 강체 포즈의 발행 패턴과 부합합니다. MuJoCo는 상태 추정, 역동역학, 제어, 머신러닝 샘플링에 사용할 수 있습니다.[6] Active Center는 ROS, C++, Python, Matlab, MuJoCo, Isaac, OpenSim, C3D, 콘텐츠 엔진 인터페이스를 나열합니다.[3] 메시지 형식, 타임스탬프, 좌표계, 단위, 신뢰도, 버전을 공개해야 합니다.

구조화 데이터는 정보 손실도 의미합니다. 키포인트만 저장하면 미래 알고리즘이 원본 영상에서 당시 무시된 세부 정보를 다시 식별할 수 없습니다. 모델 판단이 틀리면 구조화 결과가 오류를 고착시킬 수 있습니다. 따라서 시스템은 프로젝트별로 원본 영상을 저장할지, 얼마나 오래 저장할지, 어떤 클립이 HPE에 들어갈지, 어떤 것은 골격만 남길지 결정할 수 있어야 합니다. 인프라의 성숙은 가벼운 데이터만 전송하는 것이 아니라, 재검토 가능성, 프라이버시, 비용 사이에서 명시적으로 선택할 수 있는 것입니다.

7. 엣지 AI의 다섯 가지 검수 질문

첫째, 엔드투엔드 지연을 어떻게 측정하는가. 시간 시작점과 종료점, 카메라 수, 인원 수, 출력 골격, 대상 애플리케이션을 제시해야 합니다. 둘째, 규모를 어떻게 측정하는가. 카메라와 인원이 늘어난 뒤 프레임레이트, 지연, 신원, 프레임 드롭이 어떻게 변하는가. 셋째, 이상을 어떻게 보는가. 단일 카메라, 네트워크, 캘리브레이션, 모델 이상에 읽을 수 있는 진단이 있는가. 넷째, 버전을 어떻게 관리하는가. 카메라와 중앙 소프트웨어가 호환되는지, 업그레이드가 과거 데이터에 영향을 주는지. 다섯째, 데이터를 어떻게 보호하는가. 영상, 키포인트, 로그, 업그레이드 패키지가 각각 어디에 있고 누가 접근할 수 있는가.

테스트 동작도 실제 어려움을 포함해야 합니다. 빠른 회전, 바닥에 내려갔다 올라오기, 팔 교차, 헐렁한 의복, 여러 사람의 위치 교환, 가장자리 영역, 강약 조명 전환, 소품 가림입니다. 각 실패에 대해 문제가 2D 검출, 카메라 간 매칭, 삼각측량, 골격 제약, 또는 하위 리타게팅 중 어디인지 기록해야 합니다. 장애를 링크까지 위치시킬 수 있을 때에만 엣지 아키텍처가 실제 운영상 이점으로 전환됩니다.

우리는 이 다섯 가지 질문을 공개 검수 체크리스트로 정리했으며, 고객이 자신의 동작, 공간 조건, 소프트웨어를 가져와 PoC를 진행하는 것도 환영합니다. 테스트 조건, 실패 경계, 정리 비용을 완전하게 제시하는 것은 이상적인 출력만 보여주는 것보다 전문 고객이 시스템이 자신의 워크플로에 맞는지 판단하는 데 더 도움이 됩니다.

8. 결론: 엣지 AI의 종착점은 운영 가능한 모션 공간

엣지 AI가 모션 캡처를 바꾸는 이유는 각 카메라에 연산 칩이 하나 더 있기 때문이 아니라, 지각, 계산, 데이터, 애플리케이션의 관계가 다시 조직되기 때문입니다. 카메라端이 먼저 2D 화면을 이해하고, 로컬 중심이 3D를 융합하며, 실시간 데이터가 산업 애플리케이션으로 들어가고, 핵심 클립은 다시 HPE를 수행합니다. 이 계층화는 더 큰 공간, 더 낮은 피드백 지연, 더 명확한 데이터 경계를 지원할 기회를 제공합니다.

고객 입장에서 엣지 아키텍처의 가치를 판단하려면 중앙 GPU만 비교할 것이 아니라 전체 운영 비용도 비교해야 합니다. 카메라端 계산은 중앙 추론 부담을 줄일 수 있지만, 장비 수, 펌웨어 관리, 현장 진단을 늘립니다. 로컬 운행은 공용 인터넷 의존을 줄일 수 있지만, 고객에게 서버, 계정, 백업 관리를 요구합니다. 우리는 실제 프로젝트에서 배포 공수, 네트워크 구성, 중앙 이용률, 장애 횟수, 복구 시간, 유효 데이터 비율을 기록하고, 같은 작업으로 다른 아키텍처와 비교할 것입니다. 이러한 장기 기록이 없을 때 가장 엄밀한 표현은 여전히 “아키텍처는 확장과 현장 제어 개선을 목표로 한다”이며, 확정적인 비용 절감을 직접 약속하는 것은 아닙니다.

Semcam Live의 아키텍처 방향은 이 흐름과 일치하며, 우리는 엔드투엔드 테스트 프로토콜, 규모화 배포 가이드, 장시간 운행 기록, 인터페이스 예시, 데이터 거버넌스 설명, 실제 고객 사례를 계속 보완할 것입니다. 우리는 TOPS를 성능 결론으로 삼지 않고, 로컬을 자동 보안과 동일시하지도 않습니다. Semcam Live가 진정으로 하고자 하는 일은 공간이 더 이상 단순히 녹화만 하는 곳이 아니라, 현장에서 움직임을 이해하고, 데이터를 출력하며, 결과에 책임지는 곳이 되게 하는 것입니다.

정보 및 인용 설명

- 제품 정보: 카메라側 작업, TOPS, 소비전력, 120fps, 지연, ULTRA 사양과 인터페이스는 현재 공개된 제품 정보를 기준으로 합니다. 확장성, 대역폭, 장시간 운행, 완전한 지연은 프로젝트 테스트와 결합해 확인해야 합니다.

- 산업 자료: 엣지 컴퓨팅, 클라우드 보안, ROS, MuJoCo에 대한 설명은 공식 문서에서 가져왔습니다.

- 구현 제안: 본문의 다섯 가지 검수 질문과 거버넌스 제안은 전문 배포를 위해 우리가 정리한 방법이며, 모든 능력이 모든 구성에서 자동으로 성립한다는 뜻은 아닙니다.

참고 자료

1. NIST SP 500-325: 포그 컴퓨팅 개념 모델 (https://csrc.nist.gov/pubs/sp/500/325/final)

2. Semcam Live 제품 페이지 (https://semcamlive.com/zh/SemcamLive)

3. Semcam Active Center 제품 페이지 (https://semcamlive.com/zh/active-center)

4. NIST SP 800-144: 퍼블릭 클라우드 컴퓨팅 보안 및 개인정보 가이드라인 (https://csrc.nist.gov/pubs/sp/800/144/final)

5. ROS 2 공식 문서: Topics (https://docs.ros.org/en/ros2_documentation/kilted/Concepts/Basic/About-Topics.html)

6. MuJoCo 공식 문서: Overview (https://mujoco.readthedocs.io/en/stable/overview.html)

모든 정보로 돌아가기SEMCAM LIVE NEWSROOM