Zurück zur InformationProdukteinführung

Menschen markerlos, Objekte hochpräzise: Warum KI und optisches Mocap zusammenarbeiten müssen

Professionelle Szenen bestehen selten nur aus einer Person. Roboter, Werkzeuge, Headsets, Requisiten, Trainingsgeräte und Kameras gehören zur Aufgabe. KI sollte natürliche menschliche Bewegung erfassen, optisches Trackin

2026.08.246 MIN
Veröffentlichung:Semcam Live
Teilen:
Menschen markerlos, Objekte hochpräzise: Warum KI und optisches Mocap zusammenarbeiten müssen

Kernaussage: Professionelle Einsatzumgebungen bestehen selten nur aus einer einzelnen Person. Roboter, Werkzeuge, Headsets, Requisiten, Trainingsgeräte und Kameras bilden gemeinsam die Aufgabe. KI sollte natürliche menschliche Bewegung übernehmen, das optische System die zentralen Starrkörper, und beide sollten in dasselbe Koordinatensystem und auf dieselbe Zeitachse gestellt werden. Das ist praktikabler als die Vorstellung, reine KI könne alles lösen.

1. Warum „Menschen sehen“ noch nicht bedeutet, „Aufgaben zu verstehen“

Eine demonstrierende Person streckt den Arm aus, beugt sich und dreht sich. Das menschliche Knochenmodell kann Veränderungen von Gelenken und Körpersegmenten beschreiben. Wenn das System jedoch nicht weiß, welches Werkzeug die Person hält, wie dieses Werkzeug ausgerichtet ist, ob es das Ziel berührt oder ob der Roboterendpunkt folgt, kann es nur beantworten, „wie sich der Mensch bewegt“, aber nicht, „wie die Aufgabe erledigt wird“. Bei robotischem Imitationslernen, Simulationstraining, LBE und virtueller Produktion wird das Aufgabenergebnis meist durch die Beziehung zwischen Mensch und Objekt bestimmt.

KI-basierte markerlose Bewegungserfassung ist stark darin, menschliche Strukturen aus großen Trainingsmengen zu erkennen. Menschen können sich dadurch natürlich bewegen, ohne Marker anzubringen oder Sensoren zu tragen. Optisches Marker-Mocap fügt einen Vorbereitungsschritt hinzu, bietet aber für klar geformte Starrkörper direkte und identifizierbare optische Merkmale. Die hybride Lösung Semcam Live + Goku beruht genau auf diesen Stärken und macht die Echtzeit-Erfassung von Menschen und Objekten in derselben Szene und im gemeinsamen Koordinatensystem praktikabel.

2. Drei Grenzen rein markerloser Lösungen, die leicht übersehen werden

Die erste Grenze ist die Objektgrenze. Branchenkommunikation verkürzt „der Mensch braucht keine Marker“ häufig zu „vor Ort werden gar keine Marker benötigt“. Tatsächlich können Werkzeuge, Requisiten, Geräte und andere Objekte ihre Sechs-Freiheitsgrad-Pose offensichtlich nicht aus einem allgemeinen Modell menschlicher Körperhaltung erhalten. Wenn ein Projekt für Objekte Millimeterpräzision oder noch strengere Genauigkeit verlangt, bleibt optische Erfassung heute die praktikable Lösung.

Die zweite Grenze ist die Identitätsgrenze. Wenn mehrere Personen einander kreuzen und mehrere ähnliche Requisiten gleichzeitig auftreten, muss das System nicht nur erkennen, „hier ist ein Mensch oder Objekt“, sondern die Identität über die Zeit halten. Human ReID kann Aussehen und Bewegungsfortsetzung nutzen, während Starrkörper-Markercluster Objekte über ihre geometrische Anordnung identifizieren.

Die dritte Grenze ist die Bewertungsgrenze. Fehler menschlicher Bewegung werden meist als Keypoint-Abstand, Gelenkwinkeldifferenz, Trajektorienähnlichkeit oder Genauigkeit einer Aufgabenklassifikation beschrieben. Objekte, also Starrkörper, werden dagegen üblicherweise über Positionskoordinaten und räumliche Orientierung dargestellt.

3. Was unsere Hybridarchitektur tatsächlich macht

Semcam Live extrahiert im Mehrkamerasystem zunächst kameraseitig Personendetektion, Segmentierung, 2D-Keypoints, ReID und Konfidenz. Active Center übernimmt anschließend kamerübergreifendes Matching, Triangulation, 3D-Keypoints, Knochenmodell-Solving und Ausgabe. Das optische Goku-System verfolgt Starrkörper wie Roboter, Werkzeuge, Requisiten, Controller, Kameras und Trainingsgeräte. Beide Datentypen verwenden in Active Center ein einheitliches Koordinatensystem, eine gemeinsame Zeitachse und eine gemeinsame Projektverwaltung. Diese „Einheitlichkeit“ umfasst mindestens drei Ebenen: geometrische Einheitlichkeit, sodass Positionen von Menschen und Objekten im selben Raum verglichen werden können; zeitliche Einheitlichkeit, sodass eine Handgeste in einem Frame der Werkzeugpose im selben Moment entspricht; und projektbezogene Einheitlichkeit, sodass Benennung, Wiedergabe und Export von Daten nicht über mehrere Softwarepakete hinweg wiederholt abgeglichen werden müssen. Nur wenn alle drei Ebenen erfüllt sind, können Teams Mensch-Objekt-Abstände, Kontaktereignisse, Bewegungsphasen und Kooperationsbeziehungen zuverlässig berechnen.

4. Robotik: Von „menschliche Haltung imitieren“ zu „Mensch-Objekt-Beziehungen reproduzieren“

Die Datenerfassung für humanoide Roboter wird häufig darauf reduziert, menschliche Gelenke auf Robotergelenke abzubilden. Mensch und Roboter unterscheiden sich jedoch in Knochenmodellproportionen, Freiheitsgraden, Gelenkgrenzen, Massenverteilung und Kollisionsbeschränkungen. Ein menschliches Knochenmodell kann deshalb nicht direkt als sicherer Steuerbefehl dienen. Die Daten müssen Koordinatentransformation, Retargeting, Constraints, Glättung, Kontakterkennung und Sicherheitsstrategien durchlaufen. MuJoCo positioniert sich als allgemeine Physik-Engine für Robotik, Biomechanik und Machine Learning, während NVIDIA Isaac Sim Roboteranwendungen über ROS 2 mit Simulation verbindet. In dieser Kette entscheiden Starrkörperdaten darüber, ob eine Demonstration Aufgabenbedeutung hat. Beim Beispiel „einen Schraubenschlüssel aufnehmen und eine Schraube festziehen“ beschreibt die menschliche Handtrajektorie nur die Bewegungsform. Die Pose des Schraubenschlüssels erklärt Greifen und Rotation; die Pose des Zielteils zeigt, ob das Werkzeug die richtige Position erreicht; der Roboterzustand zeigt, ob die Reproduktion gelungen ist. Wenn diese Daten aus unterschiedlichen Systemen stammen und Uhrzeiten sowie Koordinaten nicht übereinstimmen, senkt umfangreicher manueller Abgleich die Datenproduktivität.

Was Semcam Live + Goku zuerst belegen soll, ist nicht nur eindrucksvolle Echtzeit-Teleoperation, sondern ein prüfbares Datenpaket: menschliches Knochenmodell, Hand-Keypoints, Werkzeug-6DoF, Roboterendpunkt, Zeitstempel, Koordinatendefinitionen, Qualitätslabels und Beispiele für den Import in ROS/MuJoCo/Isaac.

5. LBE und Simulationstraining: Neben körperlicher Präsenz braucht es Requisiten und Prozesse

In LBE VR liefern Headset und Controller normalerweise Kopf- und Handpositionen, doch Spielende sehen in der virtuellen Welt möglicherweise keinen vollständigen Körper und können die natürlichen Bewegungen anderer Personen nur schwer wahrnehmen. Markerlose Erfassung mit Semcam Live kann menschliche Bewegung in Echtzeit erfassen, den Zwang zu Trackern an Taille, Füßen und anderen Stellen traditioneller optischer Setups reduzieren und den Betrieb von Standorten effizienter machen. Goku verfolgt Headsets, Controller, Waffen, Requisiten, interaktive Mechaniken und andere Objekte. Beide Systeme werden gemeinsam durch Active Center verwaltet.

Simulationstraining legt noch stärkeren Wert auf Prozessnachweise. Betrachtet man nur den Körper, erkennt man vielleicht, dass ein Lernender sich beugt oder den Arm hebt. Man weiß aber nicht, ob das richtige Gerät ausgewählt wurde, ob ein Ventil bis zur Zielposition gedreht wurde, ob eine Trage waagerecht bleibt oder ob zwei Personen synchron zusammenarbeiten. Durch die Fusion von Semcam Live + Goku können Starrkörpertrajektorien und menschliche Bewegungen zusammengeführt werden, sodass eine Auswertung entlang von „Bewegung—Objekt—Aufgabenknoten“ möglich wird.

6. Fazit: Professionalität heißt nicht, an einer Technologie festzuhalten, sondern Verantwortung für Ergebnisse zu übernehmen

Der Wert markerloser Personenerfassung mit Semcam Live liegt in Natürlichkeit, Geschwindigkeit und Nachhaltigkeit. Der Wert der optischen Goku-Erfassung für Objekte, also Starrkörper, liegt in hochgradig bestimmbarer Pose. Werden beide in dasselbe Koordinatensystem und auf dieselbe Zeitachse gestellt, lässt sich die Beziehung zwischen Menschen, Robotern, Werkzeugen, Requisiten und Geräten vollständiger aufzeichnen. Dies ist ein wichtiger Weg, auf dem sich Semcam Live von gewöhnlichem Video-Mocap unterscheidet, und zugleich ein Kernvorteil in Robotertraining, LBE VR und Simulationstraining.