Retour aux informationslancement de produit

Humains sans marqueurs, objets de haute précision : pourquoi associer IA et mocap optique

Un site professionnel ne se résume presque jamais à une seule personne. Robots, outils, casques, accessoires, équipements d’entraînement et caméras font partie de la tâche. L’IA suit le corps humain naturel, l’optique su

2026.08.246 MIN
Libération :Semcam Live
Partager :
Humains sans marqueurs, objets de haute précision : pourquoi associer IA et mocap optique

Idée centrale : un site professionnel ne se résume presque jamais à une seule personne. Robots, outils, casques, accessoires, équipements d’entraînement et caméras forment ensemble la tâche. Confier à l’IA le mouvement humain naturel, au système optique les corps rigides clés, puis placer les deux dans le même repère et sur la même chronologie est une voie plus déployable que l’idée selon laquelle une IA pure pourrait tout résoudre.

1. Pourquoi « voir la personne » ne signifie pas encore « comprendre la tâche »

Un démonstrateur tend le bras, se penche et se tourne. Le squelette humain peut décrire les variations des articulations et des segments corporels. Mais si le système ne sait pas quel outil il tient, comment cet outil est orienté, s’il touche la cible ou si l’effecteur terminal du robot le suit, il ne peut répondre qu’à « comment la personne bouge », pas à « comment la tâche est accomplie ». Dans l’apprentissage par imitation robotique, la simulation de formation, le LBE et la production virtuelle, le résultat d’une tâche est généralement déterminé par la relation entre la personne et l’objet.

La capture de mouvement IA sans marqueurs excelle à reconnaître la structure humaine à partir de grands volumes d’exemples d’entraînement, ce qui permet aux personnes de bouger naturellement sans marqueurs ni capteurs portés. La capture optique à marqueurs ajoute une étape de préparation, mais elle apporte aux corps rigides de forme claire des caractéristiques optiques directes et identifiables. La solution hybride Semcam Live + Goku s’appuie précisément sur ces deux forces pour rendre possible une capture mixte en temps réel des personnes et des objets dans un même repère.

2. Trois limites souvent ignorées dans les solutions entièrement sans marqueurs

La première limite concerne les objets. La communication du secteur réduit souvent « le corps humain n’a pas besoin de marqueurs » à « le site n’a besoin d’aucun marqueur ». En réalité, les outils, accessoires, instruments et autres objets ne peuvent évidemment pas obtenir une pose à six degrés de liberté à partir d’un modèle général de posture humaine. Si un projet exige une précision millimétrique, voire plus stricte, pour les objets, la capture optique reste aujourd’hui la voie praticable.

La deuxième limite concerne l’identité. Lorsque plusieurs personnes se croisent et que plusieurs accessoires similaires apparaissent en même temps, le système doit non seulement détecter « il y a une personne ou un objet ici », mais aussi maintenir son identité dans le temps. Le ReID humain peut exploiter l’apparence et la continuité du mouvement, tandis que les grappes de marqueurs de corps rigides identifient les objets par leur géométrie.

La troisième limite concerne l’évaluation. L’erreur du mouvement humain s’exprime généralement par distance entre points clés, écart d’angle articulaire, similarité de trajectoire ou précision de classification de tâche. Les objets, ou corps rigides, sont plutôt décrits par leurs coordonnées de position et leur orientation spatiale.

3. Ce que fait réellement notre architecture hybride

Les caméras Semcam Live extraient d’abord côté caméra la détection humaine, la segmentation, les points clés 2D, le ReID et la confiance. Active Center réalise ensuite l’association entre caméras, la triangulation, les points clés 3D, la résolution du squelette et la sortie des données. Le système optique Goku sert au suivi des corps rigides tels que robots, outils, accessoires, contrôleurs, caméras et équipements d’entraînement. Les deux types de données utilisent dans Active Center un repère, une chronologie et une gestion de projet unifiés. Cette « unification » comporte au moins trois niveaux : l’unification géométrique, qui permet de comparer positions humaines et positions d’objets dans le même espace ; l’unification temporelle, qui associe le geste de la main dans une image à la pose de l’outil au même instant ; et l’unification de projet, qui évite de réaligner sans cesse les noms de données, la lecture et l’export entre plusieurs logiciels. Lorsque ces trois niveaux sont réunis, l’équipe peut calculer de manière fiable les distances personne-objet, les événements de contact, les phases d’action et les relations de collaboration.

4. Robotique : de « l’imitation de posture humaine » à la reproduction des relations personne-objet

La collecte de données pour robots humanoïdes est souvent simplifiée en une correspondance entre articulations humaines et articulations robotiques. Mais humains et robots n’ont pas les mêmes proportions squelettiques, degrés de liberté, limites articulaires, distributions de masse ni contraintes de collision ; un squelette humain ne peut donc pas devenir directement une commande de contrôle sûre. Les données doivent passer par transformation de coordonnées, retargeting, contraintes, lissage, détection de contact et stratégie de sécurité. MuJoCo se positionne comme un moteur physique général pour la robotique, la biomécanique et l’apprentissage automatique, tandis que NVIDIA Isaac Sim relie applications robotiques et simulation via ROS 2. Dans cette chaîne, les données de corps rigides déterminent si la démonstration a un sens de tâche. Dans l’exemple « saisir une clé et serrer un boulon », la trajectoire de la main humaine décrit seulement la forme du mouvement ; la pose de la clé décrit la prise et la rotation ; la pose de la pièce cible indique si l’outil atteint la bonne position ; l’état du robot indique si la reproduction réussit. Si ces données viennent de systèmes différents, avec horloges et repères incohérents, l’alignement manuel réduit fortement la productivité des données.

Ce que Semcam Live + Goku doit d’abord démontrer n’est pas seulement une téléopération temps réel spectaculaire, mais un paquet de données auditable : squelette humain, points clés de main, outil en 6DoF, effecteur terminal du robot, horodatages, définition des repères, étiquettes de qualité et exemples d’import dans ROS/MuJoCo/Isaac.

5. LBE et simulation de formation : au-delà de la présence corporelle, il faut aussi les accessoires et le processus

Dans la VR LBE, le casque et les contrôleurs fournissent généralement la position de la tête et des deux mains, mais le joueur peut ne pas voir son corps complet dans le monde virtuel et percevoir difficilement les mouvements naturels de ses coéquipiers. La capture sans marqueurs Semcam Live peut capturer le mouvement humain en temps réel, lever la contrainte des Trackers portés à la taille, aux pieds et ailleurs dans les installations optiques traditionnelles, et améliorer l’efficacité opérationnelle des sites. Goku suit les casques, contrôleurs, armes, accessoires, mécanismes interactifs et autres objets. Les deux systèmes sont fusionnés et gérés ensemble par Active Center.

La simulation de formation insiste encore davantage sur la preuve de processus. Observer seulement le corps permet de savoir qu’un apprenant s’est penché ou a levé la main, mais pas s’il a choisi le bon instrument, si une vanne a tourné jusqu’à la bonne position, si un brancard est resté horizontal ou si deux personnes ont coopéré de manière synchronisée. Avec Semcam Live + Goku, les trajectoires de corps rigides et les mouvements humains peuvent se combiner pour former une revue « action—objet—nœud de tâche ».

6. Conclusion : être professionnel ne consiste pas à défendre une seule technologie, mais à répondre des résultats

La valeur de la capture humaine sans marqueurs Semcam Live tient au naturel, à la rapidité et à la continuité. La valeur de la capture optique Goku pour les objets, ou corps rigides, tient à une pose hautement déterminée. Placer les deux dans le même repère et sur la même chronologie permet d’enregistrer plus complètement les relations entre personnes, robots, outils, accessoires et équipements. C’est une voie importante qui distingue Semcam Live de la mocap vidéo ordinaire, et un avantage central dans l’entraînement robotique, la VR LBE et la simulation de formation.