返回資訊產品發布

AI 無標記,為什麼是動作捕捉的未來

AI 無標記動捕正在成為動作資料取得的重要入口,但專業市場的未來更可能是多相機視覺、邊緣運算、光學剛體追蹤與產業軟體協同,而不是某一種技術把其他方案全部取代。

2026.08.306 MIN
發布:思看(Semcam Live)
分享:
AI 無標記,為什麼是動作捕捉的未來

如果未來的動作捕捉,只是把反光標記點換成演算法,把動捕服換成攝影機,那麼「AI無標記是未來」還只是一句技術口號。

在我們看來,真正值得期待的變化並不止於「去掉標記」。AI無標記正在改變動作資料被採集、處理和使用的方式:人可以更自然地進入場地,系統可以更高頻地記錄動作,資料可以在現場即時流動,還可以繼續進入機器人、生命科學、模擬實訓、虛擬製作與互動娛樂等專業工作流。

所以,我們的答案是明確的:AI無標記會成為動作捕捉的未來。

但這個「未來」並不意味著某一種技術將無條件替代所有方案。它更像是一次基礎架構的重組——人體動作逐步由AI視覺自然獲取,關鍵物體繼續採用適合自身的高確定性追蹤方式,即時計算、採後處理和產業軟體在同一套資料鏈路中協同。

正是基於這一判斷,我們打造了思看(Semcam Live)。我們希望交付的不是一次「影片轉動作」的結果,而是一個專業空間持續理解人體、生產動作資料並連接下游應用的能力。

一、動作捕捉的未來,首先應該讓人更自然

動作捕捉的對象是人。可在很多傳統流程裡,人需要先適應系統:穿戴設備、貼上標記、反覆校準,甚至為了避免資料異常而改變服裝、動作幅度和活動範圍。技術當然可以記錄動作,卻也可能干預正在被記錄的動作。

AI無標記動捕的第一層價值,是把這種關係重新倒過來:讓系統盡量適應人,而不是讓人先適應系統。

當受試者、演員、運動員、學員或示範者能夠以更接近日常任務的狀態進入場地,動作採集就更有機會保留自然性。對於生命科學,這意味著研究者有機會在更少干預的條件下觀察步態、下蹲、起立、轉身等行為;對於機器人資料採集,示範者可以更連續地執行任務;對於模擬實訓與互動空間,參與者不必先完成複雜穿戴,系統才可能真正融入日常營運。

視覺無標記動作分析的這一方向並非某一家企業的獨立判斷。較早的產業綜述就將「及時、非侵入並具有更高外部效度的運動分析」視為長期目標,同時也提醒產業,準確性與魯棒性仍需持續驗證。[1]

我們認同這兩個方面:降低對人的干預,是無標記技術的價值;用清晰條件和可復現實驗說明結果,則是專業產品必須承擔的責任。自然進入、專業輸出,也是我們設計思看(Semcam Live)時始終堅持的起點。

二、真正的未來,不是偶爾捕捉一次,而是持續生產動作資料

準備門檻下降之後,更深層的變化才會發生。

過去,動作捕捉常常是一項稀缺資源:為了某次實驗、某段表演或某個重要專案專門組織人員、場地和設備。未來,動作捕捉會更像攝影機、感測器或資料採集終端,成為實驗室、訓練中心、機器人資料場和互動空間中的常設能力。人進入空間,動作被理解;任務完成,結構化資料進入後續流程。

這意味著衡量產品價值的方式也要改變。我們不能只問「能不能生成一段骨骼動畫」,還要問:

- 同一場地能否快速開始下一輪採集?

- 多人交叉和局部遮擋時,身分與軌跡能否持續?

- 資料能否即時進入應用,而不是只在採集結束後得到一個檔案?

- 現場能否及時發現出畫、遮擋、掉幀或低置信度,避免批量產生無效資料?

- 人體、工具、機器人和場景物件能否在統一時間軸與座標系中被理解?

- 資料能否進入客戶既有的分析、模擬、引擎和開發環境?

這些問題指向的已經不是一個「影片特效功能」,而是一套可以被反覆使用的動作資料基礎設施。思看(Semcam Live)的產品定位,正是讓固定空間具備這種長期生產動作資料的能力。

下游研究正在清楚地表達這種需求。史丹佛大學OpenCap團隊希望讓人體運動分析走出少數專業實驗室。其公開論文使用兩台或更多智慧型手機影片,結合姿態估計、深度學習與肌骨模型計算人體運動學和動力學;在一項100人現場研究中,臨床人員完成相關分析的速度達到實驗室方案的25倍,成本低於實驗室方案的1%。[2] 史丹佛大學的報導將這項工作的意義概括為讓人體運動分析惠及更多研究者、臨床人員與普通人。[3]

這項研究採用的系統、設備與計算方式並不等同於思看(Semcam Live),論文結果也不能用來證明我們的產品性能。但它驗證了一個重要的下游判斷:當採集成本、時間和專業門檻下降,動作資料就可能從小樣本、低頻次走向更大規模和更真實的場景。

我們希望在此基礎上再向前一步:不只降低一次分析的門檻,還要讓專業場地獲得同步多視角、本地即時計算、採後精細處理以及產業介面連接能力。

三、AI無標記的價值,不只屬於動畫

影視與遊戲讓大眾認識了動作捕捉,但動作資料的下一輪增長,正在來自更廣泛的專業場景。

在生命科學中,研究者關注的不只是人體「看起來怎麼動」,而是關節角、身體軌跡、重複性以及能否進入肌骨分析流程。史丹佛OpenCap論文之所以具有參考價值,不只是因為它展示了一個方便的工具,更因為研究團隊公開了樣本、動作、參考系統和誤差:在10名健康受試者的步行、下蹲、坐站與落地跳測試中,其關節角平均絕對誤差為4.5°,地面反力平均絕對誤差為體重的6.2%,關節力矩平均絕對誤差為「體重×身高」的1.2%。[2]

我們認為,這種「說明條件、報告結果、同時保留限制」的方法,比一句籠統的「高精度」更有價值。思看(Semcam Live)進入運動科學、復健研究、人因工程等場景時,也應圍繞具體動作、具體人群和具體指標接受驗證,而不是用單一參數替代客戶真正關心的研究問題。

在機器人與具身智慧中,動作資料又具有另一層價值。NVIDIA的機器人學習資料把高品質示範資料視為模仿學習的第一步,並將影片示範、動作捕捉和遙操作都列為可用的資料來源。[4] NVIDIA在人形機器人開發資料中也指出,基礎模型訓練需要大量資料,而現實世界的人體示範採集往往耗時、昂貴;真實示範、模擬與合成資料的協同,正在成為擴展訓練資料的重要路徑。[5]

這說明機器人需要的不是「更炫的骨架畫面」,而是可被訓練管線使用的動作資料:人體關節如何變化,手與工具如何相對運動,任務在什麼時間發生,資料採用什麼座標和時間戳,如何進入ROS、模擬環境或訓練框架。

對機器人團隊而言,思看(Semcam Live)的推薦價值在於:以無標記方式降低人體示範的準備負擔,以本地即時鏈路支援現場檢查和互動,再將人體、機器人與工具置於可對齊的資料關係中。它不能替代重定向、控制與安全演算法,卻可以成為更自然、更連續的人體動作資料入口。

在模擬實訓、LBE與虛擬製作中,同樣的邏輯也成立。使用者真正需要的是低延時互動、多人關係、動作過程複盤以及人體與道具的同步,而不只是把一次表演匯出成動畫檔案。動作捕捉正在從內容製作工具,成長為理解真實空間中「人如何行動」的通用技術。

四、為什麼我們選擇「多相機+邊緣AI」,而不是只處理一段影片

有些輕量化無標記產品,從單個視角或一段既有影片中估計人體動作。這種產品類型部署簡單,適合快速預演、短影片動畫和對即時空間位置要求不高的任務。

我們選擇解決另一類問題:如何讓一個真實場地長期、穩定、即時地輸出三維動作資料。

單個視角遇到側身、轉身、肢體交叉、多人遮擋或道具遮擋時,不可見部分通常需要更多依賴模型推斷。同步多相機可以從不同角度觀察同一動作,並透過標定、跨視角匹配和三角化恢復空間位置。更多相機並不自動等於更高精度,最終表現仍取決於相機布局、同步、標定、模型、光照、服裝和具體動作;但對於固定場地、多人與大範圍移動,多視角提供了更完整的幾何觀測基礎。

在思看(Semcam Live)中,我們讓相機側執行人體檢測、追蹤、分割、二維關鍵點、ReID與置信度計算,再由Active Center在本地完成跨相機匹配、三角化、三維關鍵點、骨骼解算、IK、濾波、重定向與匯出。[6][7]

我們把一部分視覺理解放到資料產生的地方,再由中心完成多視角融合,目的不是堆疊算力參數,而是讓多相機場地更接近一套可營運的系統:現場可以即時看到捕捉結果,中心端不必預設依賴公共雲,多機位可以共同覆蓋一個空間,關鍵點、置信度、骨架和軌跡還可以繼續交給下游軟體。

這套架構需要專業安裝、標定、網路與運維。對只需要偶爾處理一段素材的使用者,它未必是最輕的選擇;但如果團隊需要固定場地、多人連續採集、本地資料邊界、即時輸出或專業介面,思看(Semcam Live)更值得納入正式評估。

六、人體無標記,不等於現場所有物件都應該無標記

真實任務裡,人往往不是唯一物件。

機器人示範需要記錄工具、目標物與機器人末端;模擬實訓需要記錄器械、裝備和操作物件;LBE需要同步頭顯、手柄與道具;虛擬製作也可能需要演員、攝影機和關鍵物體保持統一關係。人體適合由AI從視覺線索中估計骨骼,剛體物件則更關心穩定的六自由度位姿。兩類物件沒有必要被迫使用同一種追蹤邏輯。

因此,我們讓思看(Semcam Live)與Goku光學追蹤系統協同工作:人體由AI無標記鏈路捕捉,機器人、工具、道具等關鍵剛體由光學鏈路追蹤,再由Active Center放入統一座標系和時間軸。[6][7]

我們並不把它描述為「所有物件都無標記」,而是按物件選擇更合適的技術。這也是思看(Semcam Live)面向機器人、模擬實訓、LBE與虛擬製作時很重要的產品特點:既保留人體自然進入的體驗,又為關鍵物體提供獨立、可融合的位姿資料。

對下游使用者來說,這種組合讓資料語義更完整。只有人體骨架時,系統可能知道「手向前移動」;同時獲得工具位姿後,應用才有機會進一步判斷手與工具的相對關係、工具是否到達目標區域、任務過程是否符合預設條件。至於抓取識別、動作評分、機器人控制或安全策略,則仍需要結合具體業務演算法和產業知識,不能由一套動捕系統自動包辦。

七、未來的動作資料,必須能夠進入客戶的工作流

動作資料只有離開示範介面、進入真實業務,才開始產生價值。

思看(Semcam Live)面向ROS、C++、Python、Matlab、MuJoCo、NVIDIA Isaac、OpenSim、Visual3D、C3D、Unreal Engine、Unity、Blender、Maya、MotionBuilder,以及FBX、BVH、參數化人體模型與高精度人體模型等開發環境、軟體和格式提供連接方向。[7]

這些介面與格式覆蓋了機器人、生命科學、動畫和即時互動的典型流程,也體現了我們的產品判斷:未來的動作捕捉不會被封閉在一個播放器中,而會成為客戶資料鏈路中的一個節點。

但介面名稱不是交付結果。真正的可用性還取決於版本、欄位、座標系、時間戳、單位、置信度、範例程式碼和技術支援。我們不僅要持續完善連接能力,也要透過任務型教學、範例工程、可下載資料和真實案例,讓使用者看見一條完整鏈路怎樣運行:從相機布置與標定,到採集與品質檢查,再到ROS訊息、C3D檔案、模擬環境或即時引擎中的最終結果。

如果您的團隊已經有成熟的軟體棧,選擇動捕系統時尤其應該帶著真實介面做測試,而不是只看相容列表。我們歡迎使用者用自己的動作、場地、骨架、網路和目標軟體驗證思看(Semcam Live),因為產品是否適合,最終要在客戶的工作流裡回答。

九、哪些團隊更適合選擇思看(Semcam Live)

如果您的核心需求只是偶爾把一段短影片轉換為動畫,且可以接受單視角限制、採後處理和素材級工作流,那麼輕量化影片動捕產品可能已經足夠。

如果您的團隊面對以下任務,思看(Semcam Live)則更值得優先評估:

- 建設可反覆使用的機器人動作資料採集場;

- 在實驗室或訓練中心開展多次、多人、長週期動作研究;

- 需要120fps級即時骨架輸出或現場互動;

- 對資料本地處理、內網運行和現場控制有明確要求;

- 需要同時理解人體動作與機器人、工具、道具等剛體物件;

- 希望把資料接入ROS、Python、MuJoCo、Isaac、OpenSim、C3D或即時引擎;

- 既需要現場回饋,也需要對關鍵資料進行採後精細處理。

我們建議從一個邊界清楚的任務開始概念驗證。例如,機器人團隊可以選擇一組雙手工具操作,生命科學團隊可以選擇步態與下蹲,模擬實訓團隊可以選擇包含明確器械和步驟的單人任務。先定義動作、空間、人數、輸出格式、延時和品質指標,再決定相機布置與系統配置。這樣的驗證比觀看一段理想示範更接近真實採購決策。

十、為什麼我們仍然堅定地選擇AI無標記

因為動作捕捉真正稀缺的,從來不只是更漂亮的一段動畫,而是足夠自然、足夠持續、足夠可用的動作資料。

當人不必為設備做大量準備,採集頻率才可能提高;當多相機與邊緣AI進入固定空間,動作資料才可能即時、連續地產生;當人體與關鍵剛體處於統一時空關係中,系統才可能理解任務而不只是姿態;當資料能夠進入機器人、生命科學、模擬和內容軟體,它才會從一次結果變成長期資產。

這就是我們理解的「未來」:

- 不是用AI替代所有感測器,而是讓每類物件採用更合適的技術;

- 不是只生成一個動畫檔案,而是讓動作資料即時進入產業工作流;

- 不是把所有原始影片預設送往公共雲,而是讓客戶可以在本地建立清晰的資料邊界;

- 不是只追求一次示範成功,而是讓一個空間能夠長期、重複地生產資料;

- 不是迴避侷限,而是用測試條件、原始結果和真實任務建立信任。

AI無標記之所以是動作捕捉的未來,不是因為「無標記」三個字聽起來更先進,而是因為它第一次讓動作資料具備了走向日常化、規模化和基礎設施化的可能。

思看(Semcam Live)所做的,是把這種可能變成一套面向專業現場的系統:以同步多相機觀察真實空間,以邊緣AI理解人體,以Active Center完成本地三維重建,以即時與HPE服務不同階段,以光學追蹤補足關鍵剛體,再透過開放介面把資料交給真正創造價值的人。

如果您的目標不只是得到一次動作結果,而是讓實驗室、資料場、訓練中心或互動空間持續生產動作資料,我們期待與您一起,用真實任務驗證思看(Semcam Live)。

未來不會由一句口號決定。它會由一次次真實採集、一次次公開驗證和一條條被打通的工作流共同建立。

而這,正是我們正在做的事。

---

回全部資訊SEMCAM LIVE NEWSROOM