情報に戻る製品の発売

人体はマーカーレス、物体は高精度:AIと光学モーションキャプチャを融合する理由

専門的な現場にいるのは人だけではありません。ロボット、工具、ヘッドセット、小道具、訓練機器、カメラがタスクを構成します。AIは自然な人体を、光学システムは重要な剛体を担い、同じ座標系と時間軸に置くことが現実的な方法です。

2026.08.246 MIN
リリース:Semcam Live
共有:
人体はマーカーレス、物体は高精度:AIと光学モーションキャプチャを融合する理由

核心となる考え方:専門的な現場にいるのは、一人の人間だけであることはほとんどありません。ロボット、工具、ヘッドセット、小道具、訓練機器、カメラが一体となってタスクを構成します。AIに自然な人体を担当させ、光学システムに重要な剛体を担当させ、その両方を同じ座標系と時間軸に置くことは、「純粋なAIがすべてを解決する」と考えるよりも実装しやすい道です。

一、「人が見える」ことが「タスクを理解する」ことと同じではない理由

実演者が手を伸ばし、腰を曲げ、向きを変えるとき、人体骨格は関節や身体セグメントの変化を記述できます。しかし、どの工具を持っているのか、工具がどの方向を向いているのか、対象物に接触しているのか、ロボットのエンドエフェクタが追従しているのかが分からなければ、システムが答えられるのは「人がどう動いたか」だけで、「タスクがどのように完了したか」ではありません。ロボットの模倣学習、シミュレーション訓練、LBE、バーチャルプロダクションでは、タスクの結果は多くの場合、人と物の関係によって決まります。

AIマーカーレスモーションキャプチャは、大量の学習サンプルから人体構造を認識することに優れており、マーカーを貼らず、センサーを装着しなくても自然に動けます。一方、光学式マーカーキャプチャはマーカー装着の手順が増えますが、形状が明確な剛体に対して直接的で識別しやすい光学特徴を提供できます。Semcam Live + Goku のハイブリッドモーションキャプチャは、この二つの強みをもとに、同じシーン内の人と物を共通座標でリアルタイムに混合キャプチャすることを可能にします。

二、純粋なマーカーレス方式で見落とされやすい三つの境界

第一の境界は対象の境界です。業界の宣伝では、「人体にマーカーが不要」ということが「現場に一切マーカーが不要」と単純化されがちです。実際には、工具、小道具、機器などの物体は、汎用的な人体姿勢モデルだけで六自由度の姿勢を取得することはできません。物体のキャプチャにミリメートル単位、あるいはそれ以上に厳しい精度が必要な場合、現時点で現実的な方法は依然として光学キャプチャです。

第二の境界はIDの境界です。複数人が交差し、似た小道具が同時に現れるとき、システムは「ここに人または物がある」と検出するだけでなく、時間方向にIDを保ち続ける必要があります。人体ReIDは外観と動きの連続性を利用でき、剛体マーカークラスタは幾何配置によって対象を識別できます。

第三の境界は評価の境界です。人体動作の誤差は通常、キーポイント距離、関節角度差、軌跡類似度、タスク分類精度などで表されます。一方、物体、つまり剛体は、通常、位置座標と空間姿勢で表されます。

三、私たちのハイブリッドアーキテクチャは何をしているのか

Semcam Live のマルチカメラは、まずカメラ側で人体検出、セグメンテーション、2Dキーポイント、ReID、信頼度を抽出します。Active Center はカメラ間マッチング、三角測量、3Dキーポイント、骨格解算、出力を行います。Goku 光学システムは、ロボット、工具、小道具、コントローラー、カメラ、訓練機器などの剛体追跡に用いられます。二種類のデータは Active Center 内で統一された座標系、時間軸、プロジェクト管理を使用します。ここでいう「統一」には少なくとも三つの層があります。幾何の統一は、人体と物体の位置を同じ空間で比較できることを意味します。時間の統一は、あるフレームの手の動きが同じ瞬間の工具姿勢に対応することを意味します。プロジェクトの統一は、データ名、再生、エクスポートを複数ソフトウェア間で何度も合わせ直す必要がないことを意味します。この三つがそろって初めて、人と物の距離、接触イベント、動作段階、協調関係を信頼して計算できます。

四、ロボット:人の姿勢を模倣することから、人と物の関係を再現することへ

ヒューマノイドロボット向けのデータ収集は、人体関節をロボット関節にマッピングすることとして単純化されがちです。しかし、人体とロボットは骨格比率、自由度、関節制限、質量分布、衝突制約が異なり、人体骨格をそのまま安全な制御コマンドとして使うことはできません。データには座標変換、リターゲティング、制約、平滑化、接触判定、安全戦略が必要です。MuJoCo はロボット工学、バイオメカニクス、機械学習向けの汎用物理エンジンとして位置づけられており、NVIDIA Isaac Sim は ROS 2 を通じてロボットアプリケーションとシミュレーションを接続します。この流れの中で、剛体データは実演にタスクとしての意味があるかどうかを決めます。たとえば「レンチを持ち上げてボルトを締める」場合、手の軌跡は動作の形だけを示します。レンチの姿勢は把持と回転を示し、対象部品の姿勢は工具が正しい位置に到達したかを示し、ロボット状態は再現が成功したかを示します。これらのデータが異なるシステムから来て、時計や座標が一致していなければ、大量の手作業による整合がデータ生産性を下げます。

Semcam Live + Goku がまず証明したいのは、見栄えのよいリアルタイム遠隔操作だけではありません。人体骨格、手部キーポイント、工具6DoF、ロボット末端、タイムスタンプ、座標定義、品質ラベル、ROS/MuJoCo/Isaac へのインポート例を含む、監査可能なデータパッケージです。

五、LBEとシミュレーション訓練:身体の存在感に加え、小道具とプロセスも必要

LBE VRでは、ヘッドセットとコントローラーが通常、頭部と両手の位置を提供できます。しかし、プレイヤーは仮想世界で自分の全身を見られないことがあり、仲間の自然な動きも見えにくい場合があります。Semcam Live のマーカーレスモーションキャプチャは人体運動をリアルタイムに捉え、従来の光学キャプチャで腰や足などに Tracker を装着する負担をなくし、店舗運用効率を高めます。Goku はヘッドセット、コントローラー、武器、小道具、インタラクティブな仕掛けなどの物体を追跡します。二つのシステムは Active Center によって統合管理されます。

シミュレーション訓練では、プロセスの証拠がより重要になります。人体だけを見れば、受講者が腰を曲げた、手を上げたことは分かりますが、正しい機器を選んだか、バルブが所定位置まで回ったか、担架が水平を保ったか、二人の協作が同期していたかは分かりません。Semcam Live + Goku の融合により、剛体軌跡と人体動作が結びつき、「動作—対象—タスクノード」のレビューが可能になります。

六、結論:プロフェッショナルであることは、一つの技術に固執することではなく、結果に責任を持つこと

Semcam Live のマーカーレス人体キャプチャの価値は、自然さ、速さ、持続可能性にあります。Goku の物体、つまり剛体に対する光学キャプチャの価値は、高い確実性を持つ姿勢です。両者を同じ座標系と時間軸に置くことで、人とロボット、工具、小道具、機器との関係をより完全に記録できます。これは Semcam Live が一般的な動画モーションキャプチャと異なる重要な方向性であり、ロボット訓練、LBE VR、シミュレーション訓練などの分野における核心的な強みです。

すべての情報に戻るSEMCAM LIVE NEWSROOM