Retour aux informationsActualités de l'entreprise

D’une session de mocap à la production continue : l’infrastructure de données de mouvement se met en place

La valeur de la capture de mouvement ne vient plus seulement d’une prise réussie, mais de la capacité d’un espace à produire en continu des données humaines et objets, gouvernées, peu intrusives et à faible latence.

2026.08.236 MIN
Libération :Semcam Live
Partager :
D’une session de mocap à la production continue : l’infrastructure de données de mouvement se met en place

Idée centrale : la valeur de la motion capture ne vient plus seulement du nombre de mouvements obtenus lors d'un tournage, mais de la capacité d'un site à produire en continu des données humaines et objets avec faible friction, faible latence et gouvernance. C'est précisément ce type d'« infrastructure de données de mouvement » que nous voulons construire avec Semcam Live.

1. Pourquoi une capture réussie ne constitue pas encore une infrastructure

Un projet de motion capture traditionnel a un début et une fin clairs : réserver le plateau, préparer l'équipement, faire entrer les acteurs, terminer le tournage, nettoyer les données, puis livrer l'animation ou les résultats d'analyse. Si la qualité de ce projet est suffisante, l'équipement et l'équipe ont rempli leur mission. Mais la robotique, les sciences de la vie, l'entraînement sportif et la formation par simulation formulent une autre exigence : le même site doit capturer chaque semaine, voire chaque jour, et les données doivent entrer dans des répertoires fixes, des coordonnées unifiées, des squelettes unifiés et des algorithmes aval, tout en restant recherchables, comparables et reproductibles six mois plus tard. Le critère passe alors de « a-t-on capturé » à « peut-on fonctionner de manière stable ».

Une infrastructure ne se résume pas à fixer des caméras au mur de façon permanente. Elle comprend au minimum des points d'entrée de perception stables, une architecture de calcul extensible, des définitions de données claires, des mécanismes d'exploitation continue, une gouvernance des permissions et de la confidentialité, une gestion des interfaces et des versions, ainsi qu'un processus opérationnel exécutable par des non-spécialistes de la motion capture. Si une couche manque, le système peut redevenir un outil de projet dépendant de quelques ingénieurs : chaque démarrage demande un diagnostic, chaque sortie est renommée à la main, chaque client reçoit un script ponctuel, et la croissance du volume rend les données plus difficiles à utiliser.

La motion capture markerless réduit le coût de préparation du corps humain et ouvre la voie à la production continue ; l'edge computing place certaines tâches de vision côté caméra et fournit une architecture pour l'extension multi-caméras ; un centre local garde les projets et données sur site et donne du contrôle à la gouvernance ; les interfaces métier envoient squelettes, keypoints et poses de corps rigides vers les outils de recherche, simulation et contenu, fournissant une sortie pour la réutilisation. Ce n'est qu'une fois ces capacités combinées que « sans équipement porté » devient un gain de productivité plutôt qu'un simple argument d'expérience.

2. Premier pilier : donner à l'espace une capacité de perception continue

La motion capture vidéo traite chaque clip comme une nouvelle entrée, tandis qu'un système multi-caméras fixe transforme le site lui-même en environnement de perception. La couverture des caméras, les champs de vision chevauchants, la qualité de calibration et la synchronisation temporelle forment la « frontière de mesure » de l'espace. Quand des personnes entrent dans cette frontière, le système doit les identifier, maintenir leur identité et produire un mouvement coordonné ; quand elles sortent, le projet doit avoir une fin et un archivage clairs. Pour les laboratoires, cela réduit la pose de marqueurs et la préparation portée de chaque sujet ; pour les centres d'entraînement, cela permet de répéter le même mouvement chaque semaine ; pour les sites de données robotiques, cela permet aux démonstrateurs d'exécuter plusieurs séries de tâches en continu.

Semcam Live utilise des multi-caméras synchronisées et exécute côté caméra la détection, le suivi, la segmentation, les keypoints 2D, ReID et le calcul de confiance, tandis qu'Active Center réalise l'appariement inter-caméras, la triangulation, les keypoints 3D, la résolution squelettique, IK, le filtrage et le retargeting.[1][2] Cette répartition décompose « voir les personnes » en chaîne de calcul gérable. En même temps, la véritable continuité doit encore être vérifiée par des tests de récupération après déconnexion caméra, de dérive longue durée, de changement d'identité multi-personnes, de performance en bord de zone et de recalibration répétée. L'architecture système ne remplace pas les données de stabilité.

La perception continue doit aussi reconnaître les conditions du terrain. Changements de lumière, arrière-plans réfléchissants, vêtements amples, auto-occlusion, mouvements au sol et croisements entre humains et objets influencent l'estimation visuelle. Le signe d'une infrastructure mature n'est pas de prétendre que ces problèmes n'existent pas, mais de surveiller la confiance, signaler une couverture insuffisante, conserver les anomalies et indiquer à l'opérateur quand une reprise est nécessaire. Nous montrerons donc la détection d'échecs et la récupération dans des sites réels, pas seulement les séquences de démonstration les plus propres.

3. Deuxième pilier : transformer les flux vidéo en flux de données structurées gouvernables

Le premier obstacle de la capture continue n'est pas l'algorithme, mais l'échelle des données. Si chaque caméra transmet et stocke longtemps de la vidéo HD à haute fréquence d'images vers un centre, la pression sur le réseau, le stockage, la recherche et les permissions augmente rapidement. Le modèle conceptuel de fog computing du NIST indique que, dans les systèmes IoT, le cloud centralisé rencontre des problèmes d'échelle, d'hétérogénéité et de forte latence dans certains scénarios, tandis que le calcul distribué et hiérarchisé peut prendre en charge des tâches d'analyse au sein du réseau.[3] Pour la motion capture, faire d'abord sortir côté caméra des résultats structurés tels que keypoints, confiance et identité est une manière de réduire la pression sur le centre.

Semcam Live met l'accent sur l'edge AI côté caméra et l'Active Center local ; le centre reçoit des données structurées alignées par numéro de frame pour réaliser la reconstruction 3D.[1][2] Cela ne signifie pas que la vidéo brute n'est jamais sauvegardée, ni que les données squelettiques n'ont aucun risque de confidentialité. Chaque projet doit encore définir les options de conservation vidéo, les durées de conservation, les rôles d'accès, le périmètre d'exportation et les mécanismes de destruction. L'objectif de l'infrastructure n'est pas « plus il y a de données, mieux c'est », mais de conserver les informations vérifiables nécessaires à la tâche et de savoir clairement quelles données quittent le site de capture.

Un projet de données de mouvement gouvernable doit avoir une nomenclature unifiée : ID anonyme de personne, date, site, tâche de mouvement, essai, versions de matériel et logiciel, version de calibration, état temps réel/HPE, étiquettes qualité et périmètre d'autorisation. Il doit aussi enregistrer le nombre de caméras, les occlusions principales, les vêtements, accessoires et anomalies. Sinon, même avec des dizaines de milliers de mouvements six mois plus tard, il sera impossible de savoir lesquels peuvent entraîner des modèles, lesquels ne servent qu'à des démonstrations et lesquels doivent être supprimés. La valeur de l'infrastructure de données vient des métadonnées et de la gestion qualité, pas seulement du nombre de fichiers.

4. Troisième pilier : répartir les rôles entre chaîne temps réel et chaîne post-capture

La production continue exige un jugement sur site. Si l'on découvre seulement après le traitement cloud qu'un sujet est sorti du cadre, qu'un acteur a été occulté par un accessoire, qu'une démonstration robotique a échoué ou que des identités de joueurs ont été confondues, la capture par lots générera beaucoup de données invalides. La première valeur de la sortie temps réel n'est donc souvent pas de « piloter un personnage de façon spectaculaire », mais le contrôle qualité : permettre à l'opérateur de voir si le squelette, la confiance et les objets clés sont normaux, puis de conserver ou refaire la prise.

Nos informations publiques actuelles indiquent que Semcam Live prend en charge une sortie temps réel à 120fps et une latence de bout en bout inférieure à 100ms, et fournit un traitement post-capture haute précision HPE.[1][2] Les chiffres de latence doivent être compris avec l'ensemble de la frontière de mesure ; le « moins de 1 centimètre » de HPE doit aussi être compris avec les conditions de test. Nous séparons clairement les deux : la chaîne temps réel sert à la prévisualisation, l'interaction, le déclenchement et le contrôle qualité sur site ; la chaîne HPE sert à l'analyse de recherche, aux données d'entraînement de haute qualité et aux plans clés. Nous ne présentons pas une précision non temps réel comme une capacité temps réel.

Cette répartition permet aussi une stratification des données. Tous les essais conservent d'abord un squelette temps réel léger et des indicateurs qualité ; seules les séquences importantes validées par filtrage sauvegardent la vidéo brute et exécutent HPE. Les essais échoués enregistrent la cause mais n'entrent pas dans le dataset officiel. Cela contrôle les coûts de calcul et de stockage tout en indiquant à l'équipe quel traitement chaque donnée a subi. Si les algorithmes sont mis à jour ensuite, il faut aussi préciser si les données historiques peuvent être recalculées et si les résultats des anciens et nouveaux modèles sont directement comparables.

5. Quatrième pilier : comprendre ensemble les relations entre humains, objets et environnement

Les données de squelette humain décrivent bien la posture, mais n'expliquent pas toujours la tâche. Une démonstration robotique doit connaître la pose relative des mains et des outils ; une formation par simulation doit connaître l'état du corps et des équipements ; LBE doit connaître les joueurs, casques, manettes et accessoires ; un tournage d'animation doit connaître les acteurs, armes et caméras. Si la production continue ne consigne que les humains, il faudra ensuite aligner manuellement les trajectoires d'objets issues de systèmes différents, et le coût temporel comme les erreurs réduiront la valeur du passage à l'échelle.

Semcam Live et le système optique Goku peuvent être fusionnés dans Active Center : humains markerless et corps rigides optiques partagent le même repère, la même timeline et le même projet.[1][2] C'est une répartition pragmatique, pas « l'AI pure résout tout ». La calibration conjointe à 0,1 millimètre décrit la précision de calibration entre deux systèmes, non la précision des keypoints humains ; les objets rigides exigent toujours le système optique et la configuration de marqueurs correspondante. Nous expliquerons ces limites en même temps que les capacités produit.

Une fois unifiées, les sémantiques de données peuvent passer de « déplacement d'articulation » à « événement de tâche » : la main approche l'outil, une prise se produit, l'outil suit une trajectoire, le corps entre dans une zone dangereuse, deux apprenants terminent une collaboration. Le jugement d'événement exige toujours des règles métier et des algorithmes ; Active Center ne réalise pas automatiquement toutes les évaluations sectorielles. Biomechanics Plugin et Action Quality Assessment Plugin ne sont pas non plus promis aujourd'hui comme modules complets officiellement livrés. À ce stade, notre valeur la plus claire est de fournir une base de données synchronisée et d'aider les clients ou partenaires sectoriels à construire leur logique d'évaluation dessus.

6. Cinquième pilier : les interfaces ouvertes font réellement circuler les données

Si l'infrastructure ne peut relire les données que dans son propre logiciel, elle devient un silo. Les équipes robotiques ont besoin de ROS, C++, Python et simulation ; les sciences de la vie ont besoin de C3D, Matlab, OpenSim ou Visual3D ; les équipes de contenu ont besoin de FBX, BVH, Unreal, Unity, Blender et Maya. Les Topic de ROS 2 conviennent à la transmission continue des états de capteurs et de robots,[4] et MuJoCo fournit des capacités de simulation physique pour la robotique, la biomécanique et le machine learning.[5] Les interfaces transforment les données de mouvement de quelque chose qui « semble utile » en entrée consommable par des programmes.

Active Center liste ces catégories d'interfaces et formats.[2] Les versions SDK, champs, conventions de coordonnées, horodatages, exemples de code et périmètres de compatibilité doivent suivre la documentation technique correspondante. Nous publierons en priorité des exemples minimaux exécutables plutôt que de seulement ajouter des Logo d'interface : par exemple publier des squelettes humains et poses de corps rigides avec ROS 2, sauvegarder keypoints et confiance avec Python, entrer dans Visual3D via C3D et réaliser le retargeting de personnage avec FBX.

Nous continuerons donc à compléter des tutoriels orientés tâche : déploiement, calibration, sortie temps réel, HPE, suivi hybride et interfaces sectorielles. Chaque étape doit disposer d'instructions recherchables et reproductibles. Pour les systèmes professionnels, les tutoriels ne servent pas seulement le marketing ; ils influencent directement la capacité du produit à entrer dans les workflows clients.

7. Conclusion : permettre à un espace de comprendre le mouvement en continu

Le cœur de l'infrastructure de données de mouvement n'est pas que l'équipement reste allumé, mais que les données forment une boucle stable depuis la capture, le jugement, le traitement et la gouvernance jusqu'à l'utilisation. Nous avons déjà établi dans Semcam Live des bases produit telles que multi-caméras, edge AI, Active Center local, double chaîne temps réel et HPE, fusion humain et corps rigide, ainsi qu'interfaces sectorielles.[1][2] Ces capacités doivent encore être améliorées et validées par l'exploitation continue, les tests de performance, l'utilisabilité du SDK et les résultats clients.

L'expression de marque qui mérite donc le plus d'être maintenue n'est pas « encore une caméra de motion capture AI », mais « donner aux espaces fixes la capacité de comprendre en continu les mouvements des humains, des robots et des objets ». Cette phrase doit être accompagnée de preuves : sorties brutes, conditions de test, tutoriels, cas, limites d'échec et historiques de versions. À mesure que ces contenus s'accumulent, Semcam ne vend plus seulement du matériel, mais une capacité organisationnelle à produire, vérifier et connecter des données de mouvement sur le long terme.