返回資訊產品發布

人體無標記,物體高精度:為什麼要融合 AI 與光學動捕

專業現場很少只有一個人。機器人、工具、頭顯、道具、訓練器材和攝影機共同構成任務。讓 AI 負責自然人體,讓光學系統負責關鍵剛體,再把兩者放進同一座標和時間軸,是比「純 AI 解決一切」更可落地的路線。

2026.08.246 MIN
發布:思看(Semcam Live)
分享:
人體無標記,物體高精度:為什麼要融合 AI 與光學動捕

核心觀點:專業現場很少只有一個人。機器人、工具、頭顯、道具、訓練器材和攝影機共同構成任務。讓 AI 負責自然人體,讓光學系統負責關鍵剛體,再把兩者放進同一座標和時間軸,是比「純 AI 解決一切」更可落地的路線。

一、為什麼「看見人」還不等於「理解任務」

一名示範者伸手、彎腰、轉身,人體骨架能夠描述關節和身體段的變化。但如果不知道他拿的是哪件工具、工具朝向如何、是否接觸目標、機器人末端是否跟隨,系統只能回答「人怎麼動」,不能回答「任務怎樣完成」。在機器人模仿學習、仿真實訓、LBE 和虛擬製作中,任務結果通常由人與物的關係決定。

AI 無標記動捕擅長從大量訓練樣本中識別人體結構,使人可以在不貼標記、不穿感測器的情況下自然運動。光學標記動捕增加了貼標記步驟,卻可以為形狀明確的剛體提供直接、可識別的光學特徵。思看(Semcam Live) + Goku 融合動捕方案正是基於兩者的優勢,使同一場景下的人和物能夠在共同座標下完成即時混合捕捉。

二、純無標記方案最容易被忽略的三道邊界

第一道邊界是對象邊界。產業宣傳常把「人體無需標記」簡化成「現場無需任何標記」。實際上,工具、道具、器械等物體,顯然不能依靠通用人體姿態模型獲得六自由度位姿。若專案對物體捕捉需要毫米甚至更嚴格的精度,目前可行的捕捉方案仍然是光學捕捉。

第二道邊界是身分邊界。多人交叉與多個相似道具同時出現時,系統不僅要偵測「這裡有一個人或物」,還要在時間上保持身分。人體 ReID 可以利用外觀和運動連續性,剛體標記簇可以透過幾何布局識別對象。

第三道邊界是評價邊界。人體動作的誤差通常用關鍵點距離、關節角差、軌跡相似度或任務分類準確率表示;物體(剛體)則通常用位置座標和空間姿態來表示。

三、我們的混合架構到底做了什麼

思看(Semcam Live) 多相機先在相機端提取人體偵測、分割、2D 關鍵點、ReID 和置信度,Active Center 完成跨相機匹配、三角化、3D 關鍵點、骨骼解算與輸出。Goku 光學系統則用於機器人、工具、道具、手柄、攝影機和訓練器材等剛體追蹤。兩類資料在 Active Center 中使用統一座標系、時間軸和專案管理。這裡的「統一」至少包含三個層次:幾何統一,意味著人體和物體的位置可以在同一空間中比較;時間統一,意味著某一幀人的手勢可以對應同一時刻工具的姿態;專案統一,意味著資料命名、回放和匯出不必在多個軟體中反覆對齊。只有三者都成立,團隊才能可靠計算人—物距離、接觸事件、動作階段和協作關係。

四、機器人:從「模仿人的姿勢」到「復現人與物的關係」

人形機器人資料採集常被簡化為把人體關節映射到機器人關節。但人體與機器人具有不同的骨骼比例、自由度、關節限位、質量分布和碰撞約束,人體骨架不能直接作為安全控制命令。資料需要經過座標變換、重定向、約束、平滑、接觸判斷和安全策略。MuJoCo 官方將其定位為面向機器人、生物力學和機器學習的通用物理引擎,NVIDIA Isaac Sim 透過 ROS 2 橋接機器人應用與仿真。在這條鏈路中,剛體資料決定示範是否有任務意義。以「拿起扳手並擰緊螺栓」為例,人體手部軌跡只能描述動作形態;扳手位姿說明抓取與旋轉;目標件位姿說明工具是否到達正確位置;機器人狀態說明復現是否成功。若這些資料來自不同系統且時鐘、座標不一致,大量人工對齊會降低資料產能。

思看(Semcam Live) + Goku 優先證明的,不只是炫目的即時遙操作,而是一套可稽核的資料包:人體骨架、手部關鍵點、工具 6DoF、機器人末端、時間戳、座標定義、品質標籤與匯入 ROS/MuJoCo/Isaac 的樣例。

五、LBE 與仿真實訓:身體存在感之外,還要有道具和流程

在 LBE VR 中,頭顯與手柄通常能提供頭部和雙手位置,但玩家在虛擬世界裡可能看不到完整身體,也難以看到同伴的自然動作。思看(Semcam Live) 無標記動捕可以即時捕捉人體運動,解除傳統光學捕捉需要在玩家腰部、腳部等位置穿戴 Tracker 的束縛,提升門店維運效率。Goku 則追蹤頭顯、手柄、武器、道具、互動機關等物體。兩套系統融合後共同由 Active Center 統一管理。

仿真實訓更強調流程證據。僅看人體可以知道學員彎腰、抬手,卻不知道是否選擇正確器械、閥門是否旋轉到位、擔架是否保持水平、兩人協作是否同步。思看(Semcam Live) + Goku 系統融合後,剛體軌跡與人體動作才能結合,才可能形成「動作—對象—任務節點」的復盤。

六、結論:專業不是堅持一種技術,而是對結果負責

思看(Semcam Live) 無標記動捕對人體捕捉的價值是自然、快速和可持續;Goku 光學捕捉對物體(剛體)的價值是高確定性位姿。將二者置於同一座標與時間軸,能夠更完整地記錄人與機器人、工具、道具和器械的關係。這是 思看(Semcam Live) 區別於普通影片動捕的重要路線,也是在機器人訓練、LBE VR 和仿真實訓等領域的核心優勢。

回全部資訊SEMCAM LIVE NEWSROOM