Retour aux informationslancement de produit

Pourquoi Semcam Live n’est pas un simple outil de mocap vidéo

Générer une animation à partir d’une vidéo et produire en continu des données de mouvement depuis un espace sont deux produits différents. Semcam Live transforme le mouvement sur site en données utilisables en temps réel

2026.08.286 MIN
Libération :Semcam Live
Partager :
Pourquoi Semcam Live n’est pas un simple outil de mocap vidéo

Idée centrale : générer une animation à partir d'une vidéo et faire produire en continu des données de mouvement par un espace sont deux types de produits différents. La valeur centrale de Semcam Live n'est pas de rendre le traitement vidéo plus proche de l'animation, mais de transformer le mouvement sur site en données utilisables en temps réel, recalculables après capture et exploitables dans les logiciels métier grâce à des caméras multiples synchronisées, à l'edge AI, à la reconstruction 3D locale et à des interfaces ouvertes.

1. Même sous le nom de "mocap AI", ces produits ne résolvent pas la même tâche

Beaucoup d'utilisateurs découvrent la capture de mouvement par AI en filmant avec un téléphone ou en téléversant une courte vidéo. Un acteur exécute un mouvement devant la caméra, la plateforme estime la posture humaine à partir de l'image, puis génère après traitement un squelette ou un fichier FBX. Le principal avantage de ce flux est sa légèreté : il n'exige pas l'achat d'une matrice complète de caméras ni l'aménagement d'un espace dédié, et les animateurs indépendants, équipes de jeu et créateurs de contenu peuvent obtenir rapidement une ébauche de mouvement exploitable.

La logique produit d'une mocap vidéo ordinaire tourne généralement autour d'une "tâche de ressource" : fournir une vidéo et obtenir un résultat d'animation. Les utilisateurs veulent savoir si le téléversement est simple, combien de temps prend le traitement, si les mains et les pieds sont stables, si le verrouillage des pieds peut être automatique, si le squelette de sortie est compatible et comment la facturation fonctionne à la seconde ou au crédit. Ces outils ont une vraie valeur, surtout pour la prévisualisation rapide et la production de contenu léger ; mais leur centre de conception est habituellement un asset de contenu ponctuel, pas une mesure continue dans un espace fixe.

Semcam Live répond à une autre catégorie de problèmes : comment un laboratoire, un terrain de données robotiques, un centre d'entraînement ou un espace interactif peut-il capturer de façon stable chaque fois qu'une personne y entre ? Comment maintenir les identités lorsque plusieurs personnes se croisent ? Comment transmettre les données de mouvement aux applications en temps réel ? Comment placer le corps humain et les outils dans le même système de coordonnées ? Les vidéos sensibles peuvent-elles rester sur site ? Après la collecte, peut-on appliquer un traitement plus précis aux séquences clés ? On ne peut pas répondre à ces questions en se contentant de "téléverser une vidéo", car elles impliquent synchronisation, calibration, répartition du calcul, réseau, latence, fusion d'objets, interfaces et exploitation.

2. Première différence essentielle : l'entrée n'est pas une vidéo, mais une scène multi-vues synchronisée

Une vidéo monoculaire ne voit qu'un seul point de vue. Quand une personne se met de profil, se retourne, passe un bras devant le torse, quand deux personnes se masquent mutuellement ou qu'un accessoire cache une articulation, l'algorithme doit s'appuyer sur les données d'entraînement et des a priori temporels pour inférer les parties invisibles. Cette inférence est parfois suffisante, mais en mesure professionnelle, l'utilisateur doit savoir si le résultat provient de contraintes géométriques réelles ou d'une complétion par modèle. Un système multi-caméras observe simultanément depuis plusieurs angles et récupère les positions 3D par calibration des caméras, synchronisation temporelle et triangulation. En théorie, cela apporte davantage d'indices d'observation pour gérer les occlusions et localiser dans l'espace ; les performances réelles dépendent toutefois de la disposition des caméras, de la précision de synchronisation, de la calibration, des modèles et des conditions de mouvement.

Côté caméras, Semcam Live réalise la détection, le suivi, la segmentation, les points clés 2D, le ReID et le calcul de confiance ; Active Center effectue localement l'appariement inter-caméras, la triangulation, les points clés 3D, la résolution squelettique, l'IK, le filtrage et le retargeting.[1][2] Cela signifie que nous ne nous contentons pas d'envoyer plusieurs flux vidéo vers un seul ordinateur pour un traitement centralisé : une partie du calcul visuel est répartie vers l'extrémité de capture, puis les résultats structurés sont envoyés au centre. Nous appelons cette approche collaborative en couches une architecture edge AI.

La portée commerciale de cette architecture est que "l'espace devient exploitable". Une fois les caméras fixes installées et calibrées, le lieu peut être réutilisé à répétition, sans rechercher à chaque fois les positions de téléphones et sans demander à chaque participant de porter le même équipement. Dans l'enseignement universitaire, les étudiants peuvent réaliser plusieurs sessions de capture pendant un seul cours ; dans les centres d'entraînement, les athlètes peuvent répéter les tests dans des conditions proches ; pour les équipes robotiques, les démonstrateurs peuvent enchaîner plusieurs séries de tâches ; pour le LBE, le système peut fonctionner pour groupe après groupe de joueurs. Atteindre réellement cette continuité exige encore une validation projet, mais l'objectif produit est clairement différent d'un traitement vidéo à l'acte.

3. Deuxième différence essentielle : le calcul se fait sur site, au lieu de dépendre par défaut du cloud

Le calcul cloud a des atouts : élasticité, mises à jour simples et faible seuil matériel initial. OpenCap utilise la vidéo sur téléphone et le traitement cloud pour rendre l'analyse cinématique et dynamique accessible à des scénarios de recherche et cliniques plus larges, et son article public décrit les appareils, les positions de caméra, les échantillons et les erreurs.[3] Le "cloud" n'est donc pas un défaut en soi. Le problème est que certains sites clients n'autorisent pas la sortie des vidéos hors de l'intranet, ou que la qualité réseau, la latence et les exigences d'exploitation continue rendent le cloud inadapté comme unique maillon.

Semcam Live met l'accent sur un déploiement entièrement local. Active Center gère sur site la reconstruction en temps réel, les projets, le traitement HPE et l'export des données. Côté caméras, le système transmet des données structurées comme des points clés alignés par numéro d'image et des valeurs de confiance, au lieu de téléverser par défaut toutes les vidéos haute définition vers un cloud public.[1][2] Cela aide à réduire la pression liée au traitement continu de multiples flux vidéo côté centre, ainsi que les besoins de transmission sur l'Internet public. Le modèle conceptuel du NIST pour le fog/edge computing indique également que le traitement distribué peut répondre aux enjeux d'échelle, d'hétérogénéité et de forte latence des systèmes IoT dans certains environnements cloud.[4]

Mais la localisation ne doit pas être présentée comme "naturellement sûre". Les serveurs locaux peuvent toujours présenter des risques liés à la configuration des droits, aux sauvegardes, aux correctifs, aux comptes et à l'accès physique ; les données squelettiques structurées peuvent aussi concerner des informations personnelles et comportementales. La formulation correcte est la suivante : une architecture locale donne aux organisations des limites de données et un contrôle opérationnel plus directs, mais la sécurité dépend au final d'une gouvernance complète. Nous publierons les politiques de conservation des données, les droits des comptes, les journaux, les mises à niveau hors ligne, la possibilité de désactiver l'enregistrement vidéo et les informations d'audit d'export, au lieu de nous limiter à dire que "les données ne sont pas téléversées".

4. Troisième différence essentielle : servir à la fois l'usage temps réel et la livraison haute qualité après capture

La mocap vidéo ordinaire part souvent du principe que l'on traite d'abord et que l'on utilise ensuite. Pour des assets d'animation, c'est parfaitement raisonnable ; mais les personnages virtuels en temps réel, la validation de téléopération robotique, la correction d'entraînement, l'interaction multi-personnes et la prévisualisation de réalisation sur site exigent une sortie à faible latence. Les informations que nous avons actuellement publiées indiquent que PRO, PRO+ et ULTRA visent tous 120fps, avec une latence de bout en bout inférieure à 100ms.[1] Ces paramètres doivent être compris avec la chaîne de test précise : lors de la recette projet, il faut indiquer clairement si l'exposition des caméras, le réseau, la résolution au centre, l'envoi par protocole et la réception par l'application cible sont tous inclus dans la mesure.

Le temps réel n'est pas automatiquement synonyme de précision maximale. Nous séparons les deux chaînes : la résolution temps réel sur site soutient l'interaction et le contrôle qualité, tandis que l'extension haute précision HPE réalise un traitement non temps réel après la capture. Les informations que nous avons actuellement publiées indiquent que l'erreur des points clés HPE peut descendre sous 1 cm ; cette métrique doit encore être comprise avec le jeu de données, le mouvement, le nombre de caméras, la distance de capture, les occlusions, les vêtements et la définition de l'erreur.[1][2] Notre formulation est donc la suivante : le même système de capture prend en charge à la fois le retour temps réel et l'amélioration de précision après capture, les performances précises étant soumises aux protocoles de test et à la recette projet.

Cette approche à double chaîne est concrète pour les clients professionnels. Les expériences robotiques peuvent utiliser les squelettes temps réel pour vérifier que les démonstrations ont été entièrement enregistrées, puis recalculer les séquences de qualité avec HPE ; les équipes d'animation peuvent prévisualiser les personnages sur site et affiner les plans clés après la capture ; les laboratoires de sciences de la vie peuvent utiliser la vue temps réel pour détecter une sortie du volume de capture ou une occlusion, puis employer les essais formels pour l'analyse haute précision. Elle gère en deux étapes la question de "l'existence d'un résultat" et celle de "la valeur livrable du résultat".

5. Quatrième différence essentielle : réunir le corps humain sans marqueurs et les corps rigides à forte certitude dans un même projet

La sortie typique de la mocap vidéo est un squelette humain, mais les sites professionnels doivent souvent aussi savoir où se trouvent les objets. L'apprentissage par imitation robotique doit enregistrer les mains humaines, l'effecteur terminal du robot et les outils ; l'entraînement en simulation doit enregistrer le corps de l'apprenant, les instruments et les objets de tâche ; le LBE doit suivre le corps des joueurs, les casques, les contrôleurs et les accessoires ; la production virtuelle doit synchroniser acteurs, armes et caméras. Voir uniquement le corps humain ne suffit pas toujours à expliquer la relation entre le mouvement et le résultat de la tâche.

Semcam Live peut être fusionné avec le système optique ZVR Goku : la chaîne AI sans marqueurs prend en charge le corps humain, la chaîne optique prend en charge les objets rigides, et Active Center place ces deux types de données dans un système de coordonnées et une chronologie unifiés.[1][2] Cela ne signifie pas que "tous les objets sont sans marqueurs", mais traduit une répartition volontaire du travail selon le type d'objet. Les 0,1 mm que nous mentionnons correspondent à la précision de calibration conjointe, et non à l'erreur de suivi humain ; ils ne doivent pas non plus être utilisés comme chiffre de précision unique pour l'ensemble du système.

L'avantage de cette combinaison ne réside pas seulement dans la précision, mais aussi dans la complétude sémantique. Avec un squelette humain seul, le système sait que "la main s'est levée" ; avec la pose de l'outil ajoutée, il peut déterminer "si la main tenait l'outil spécifié, si l'outil a atteint la zone cible et si la posture corporelle respectait la procédure". Pour la robotique, le mouvement humain doit encore passer par du retargeting, des contraintes et des contrôles de sécurité, et ne peut pas être transformé directement en commandes articulaires ; mais des relations temporelles et spatiales unifiées peuvent réduire fortement le travail d'alignement ultérieur et fournir une matière première plus complète pour l'apprentissage par imitation, la revue de téléopération et la recherche en collaboration humain-robot.

6. Cinquième différence essentielle : le livrable n'est pas un fichier d'animation, mais un ensemble de données connectables

La valeur d'un système professionnel se manifeste finalement dans les logiciels du client. Les sorties et interfaces que nous listons actuellement incluent ROS, C++, Python, Matlab, MuJoCo, NVIDIA Isaac, OpenSim, Visual3D, C3D, Unreal Engine, Unity, Blender, Maya, MotionBuilder, ainsi que FBX, BVH, modèle corporel paramétrique et modèle corporel de haute précision.[2] Les versions de SDK, définitions de champs, conventions de coordonnées, horodatages, exemples de code et périmètres de support précis doivent suivre la documentation technique correspondante et la validation projet.

Les interfaces ne sont pas un "mur de logos". Le mécanisme Topic de ROS 2 sert à publier et à s'abonner à des flux de données continus,[5] MuJoCo est un moteur physique généraliste destiné à la robotique, à la biomécanique et au machine learning,[6] et OpenSim sert à la modélisation musculosquelettique et à l'analyse du mouvement. Si un système peut produire de façon stable des données horodatées avec définitions de coordonnées et confiance, il peut entrer dans ces environnements ; inversement, même si des noms de logiciels sont listés, les clients ne pourront pas déployer sans versions, exemples et support technique.

Nous décrirons chaque interface comme une tâche concrète : comment publier des squelettes temps réel vers ROS 2 ; comment importer des trajectoires humaines et de corps rigides dans MuJoCo ou Isaac ; comment envoyer du C3D vers Visual3D ; comment retargeter un FBX vers un personnage ; comment lire les points clés et la confiance dans Python. Pour les clients professionnels, des tutoriels exécutables, des données d'exemple et des notes de version valent davantage qu'une liste de compatibilité.

7. Comment déterminer de quel type de produit vous avez besoin

Si votre tâche consiste à transformer occasionnellement de courtes vidéos en animations, que votre budget est limité, que vous ne disposez pas d'un lieu fixe et que vous pouvez accepter le traitement cloud ainsi que le nettoyage après coup, les outils ordinaires de mocap vidéo constituent généralement un point de départ plus efficace. Lors du choix, concentrez les tests sur les conditions de prise de vue, la capture des mains et des pieds, le verrouillage des pieds, le retargeting, les formats et le coût à l'usage. Il n'est pas nécessaire d'acheter un système au-delà de vos besoins au nom du mot "professionnel".

Si votre tâche exige plusieurs personnes, un espace fixe, une sortie temps réel de classe 120fps, des limites de données locales, des captures répétées entre sessions, la pose d'outils ou de dispositifs, des interfaces ROS/OpenSim/moteur temps réel et une exploitation de long terme, alors Semcam Live mérite une évaluation formelle. L'évaluation ne doit pas se limiter à regarder des vidéos de démonstration ; elle doit réaliser une preuve de concept avec le lieu réel et les mouvements réels, en consignant le nombre de caméras, la surface couverte, le temps de calibration, les occlusions, les pertes d'images, les changements d'identité, la latence de sortie, le temps de nettoyage et la stabilité des interfaces.

L'état du produit doit aussi entrer dans la décision. Les informations que nous avons actuellement publiées indiquent que PRO prend en charge 4 personnes, 18 mètres et la capture temps réel ; PRO+ ajoute HPE et les doigts ; ULTRA est prévu avec 100 TOPS, 5,2 mégapixels, 12 personnes, 45 mètres, HPE, doigts et visage, mais la FAQ indique encore "prochainement".[1] Avant que ULTRA n'achève une validation publique de livraison, nous le signalerons clairement comme modèle de préversion ou modèle prévu. Le Biomechanics Plugin et le Action Quality Assessment Plugin ne sont pas non plus actuellement promis comme modules complets officiellement livrés.

8. Conclusion : nous livrons une capacité continue de données de mouvement

Semcam Live se positionne comme un système local de données de mouvement multi-caméras à edge AI pour les sites professionnels. Ses différences avec la mocap vidéo ordinaire viennent de six niveaux : entrée multi-vues synchronisée, calcul collaboratif entre le côté caméras et le côté centre, double chaîne temps réel et HPE, fusion du corps humain et des corps rigides, gouvernance locale et interfaces métier. Nous ne mettons donc pas seulement l'accent sur le fait qu'aucune combinaison de mocap n'est requise, mais sur la capacité d'un espace à produire des données de mouvement de manière stable, continue et vérifiable.

Dans le même temps, un positionnement au niveau système exige une responsabilité de preuve plus forte. Nous publierons les conditions de test, les limites d'échec, les sorties brutes, les tutoriels de déploiement, les exemples SDK et les résultats clients. Le contenu le plus convaincant n'est pas de dire que "nous sommes plus professionnels que la mocap vidéo", mais de montrer comment un site robotique, un laboratoire de sciences de la vie ou un espace d'entraînement fonctionne de bout en bout, depuis l'installation, la calibration et la capture jusqu'à l'usage temps réel et l'analyse des données, en expliquant chaque paramètre dans la tâche réelle. C'est seulement ainsi que les clients comprendront que Semcam Live ne vend pas une génération d'animation ponctuelle, mais la capacité d'un espace à produire continuellement des données de mouvement.