Volver a la informaciónlanzamiento de producto

Humanos sin marcadores, objetos de alta precisión: por qué combinar IA y mocap óptico

En un entorno profesional rara vez hay solo una persona. Robots, herramientas, visores, accesorios, equipos de entrenamiento y cámaras forman parte de la tarea. La IA debe captar el cuerpo humano natural, el sistema ópti

2026.08.246 MIN
Lanzamiento:Semcam Live
Compartir:
Humanos sin marcadores, objetos de alta precisión: por qué combinar IA y mocap óptico

Idea central: en entornos profesionales rara vez hay una sola persona. Robots, herramientas, visores, accesorios, equipos de entrenamiento y cámaras forman juntos la tarea. Dejar que la IA se encargue del cuerpo humano natural, que el sistema óptico se encargue de los cuerpos rígidos críticos y situar ambos en las mismas coordenadas y línea temporal es una vía más aplicable que pensar que la “IA pura lo resuelve todo”.

1. Por qué “ver a la persona” todavía no equivale a “entender la tarea”

Un demostrador extiende la mano, se inclina y gira. El esqueleto humano puede describir cambios en articulaciones y segmentos corporales. Pero si el sistema no sabe qué herramienta sostiene, cuál es su orientación, si toca el objetivo o si el efector final del robot la sigue, solo puede responder “cómo se mueve la persona”, no “cómo se completa la tarea”. En aprendizaje por imitación robótica, entrenamiento por simulación, LBE y producción virtual, el resultado de la tarea suele depender de la relación entre personas y objetos.

La captura de movimiento sin marcadores basada en IA destaca al reconocer la estructura humana a partir de grandes conjuntos de entrenamiento, permitiendo que las personas se muevan con naturalidad sin pegar marcadores ni llevar sensores. La captura óptica con marcadores añade pasos de preparación, pero proporciona rasgos ópticos directos e identificables para cuerpos rígidos de forma definida. La solución híbrida Semcam Live + Goku se basa precisamente en las ventajas de ambas tecnologías y hace realidad la captura mixta en tiempo real de personas y objetos dentro del mismo sistema de coordenadas.

2. Tres límites que suelen pasarse por alto en las soluciones puramente markerless

El primer límite es el del objeto. La comunicación del sector suele simplificar “el cuerpo humano no necesita marcadores” como “en el sitio no hace falta ningún marcador”. En realidad, herramientas, accesorios, instrumentos y otros objetos no pueden obtener una pose de seis grados de libertad a partir de un modelo general de postura humana. Si un proyecto exige precisión milimétrica, o incluso más estricta, para capturar objetos, la opción viable hoy sigue siendo la captura óptica.

El segundo límite es el de la identidad. Cuando varias personas se cruzan y aparecen al mismo tiempo varios accesorios similares, el sistema no solo debe detectar “aquí hay una persona u objeto”, sino mantener su identidad a lo largo del tiempo. El ReID humano puede aprovechar apariencia y continuidad de movimiento, mientras que los clústeres de marcadores de cuerpo rígido identifican objetos por su disposición geométrica.

El tercer límite es el de la evaluación. El error del movimiento humano suele expresarse mediante distancia entre puntos clave, diferencia de ángulos articulares, similitud de trayectoria o precisión de clasificación de tareas. Los objetos, o cuerpos rígidos, normalmente se representan mediante coordenadas de posición y orientación espacial.

3. Qué hace exactamente nuestra arquitectura híbrida

El sistema multicámara Semcam Live extrae primero en la propia cámara detección humana, segmentación, puntos clave 2D, ReID y confianza. Active Center completa la correspondencia entre cámaras, la triangulación, los puntos clave 3D, la resolución del esqueleto y la salida de datos. El sistema óptico Goku se utiliza para el seguimiento de cuerpos rígidos como robots, herramientas, accesorios, mandos, cámaras y equipos de entrenamiento. Ambos tipos de datos utilizan en Active Center un sistema de coordenadas, una línea temporal y una gestión de proyecto unificados. Esta “unificación” incluye al menos tres niveles: unificación geométrica, que permite comparar posiciones humanas y de objetos en el mismo espacio; unificación temporal, que permite asociar el gesto de una mano en un fotograma con la pose de la herramienta en ese mismo instante; y unificación de proyecto, que evita alinear repetidamente nombres, reproducción y exportación de datos entre varios programas. Solo cuando los tres niveles se cumplen, los equipos pueden calcular con fiabilidad distancias persona-objeto, eventos de contacto, fases de acción y relaciones de colaboración.

4. Robótica: de “imitar la postura humana” a “reproducir la relación entre persona y objeto”

La captura de datos para robots humanoides suele simplificarse como un mapeo de articulaciones humanas a articulaciones robóticas. Pero humanos y robots tienen proporciones óseas, grados de libertad, límites articulares, distribución de masa y restricciones de colisión diferentes, por lo que un esqueleto humano no puede convertirse directamente en una orden de control segura. Los datos deben pasar por transformación de coordenadas, retargeting, restricciones, suavizado, juicio de contacto y estrategias de seguridad. MuJoCo se posiciona como un motor físico general para robótica, biomecánica y aprendizaje automático, mientras que NVIDIA Isaac Sim conecta aplicaciones robóticas y simulación mediante ROS 2. En esta cadena, los datos de cuerpos rígidos determinan si una demostración tiene significado de tarea. Por ejemplo, en “recoger una llave inglesa y apretar un perno”, la trayectoria de la mano humana solo describe la forma del movimiento; la pose de la llave indica agarre y rotación; la pose de la pieza objetivo indica si la herramienta llegó a la posición correcta; y el estado del robot indica si la reproducción tuvo éxito. Si estos datos proceden de sistemas distintos y sus relojes y coordenadas no coinciden, gran parte de la alineación manual reducirá la productividad de los datos.

Lo que Semcam Live + Goku debe demostrar primero no es solo una teleoperación vistosa en tiempo real, sino un paquete de datos auditable: esqueleto humano, puntos clave de manos, herramienta en 6DoF, efector final del robot, marcas temporales, definición de coordenadas, etiquetas de calidad y ejemplos de importación a ROS/MuJoCo/Isaac.

5. LBE y entrenamiento por simulación: además de presencia corporal, hacen falta accesorios y procesos

En LBE VR, el visor y los mandos suelen proporcionar posiciones de cabeza y manos, pero en el mundo virtual el jugador puede no ver su cuerpo completo y también puede tener dificultad para percibir los movimientos naturales de sus compañeros. La captura sin marcadores de Semcam Live puede capturar el movimiento humano en tiempo real, eliminar la obligación de llevar Trackers en cintura, pies y otras zonas propia de configuraciones ópticas tradicionales, y mejorar la eficiencia operativa del local. Goku rastrea visores, mandos, armas, accesorios, mecanismos interactivos y otros objetos. Ambos sistemas se fusionan y se gestionan juntos desde Active Center.

El entrenamiento por simulación pone más énfasis en la evidencia del proceso. Mirando solo el cuerpo humano puede saberse que un alumno se inclinó o levantó la mano, pero no si eligió el equipo correcto, si una válvula giró hasta su posición, si una camilla se mantuvo horizontal o si dos personas colaboraron de forma sincronizada. Con Semcam Live + Goku, las trayectorias de cuerpos rígidos y el movimiento humano pueden combinarse para formar una revisión de “acción—objeto—nodo de tarea”.

6. Conclusión: ser profesional no es insistir en una sola tecnología, sino responder por los resultados

El valor de la captura humana sin marcadores de Semcam Live está en la naturalidad, la rapidez y la sostenibilidad. El valor de la captura óptica Goku para objetos, o cuerpos rígidos, está en la pose de alta certeza. Situar ambas en las mismas coordenadas y línea temporal permite registrar de forma más completa la relación entre personas, robots, herramientas, accesorios y equipos. Esta es una línea importante que distingue a Semcam Live de la captura de movimiento por vídeo convencional, y también una ventaja central en entrenamiento robótico, LBE VR y entrenamiento por simulación.

Volver a toda la informaciónSEMCAM LIVE NEWSROOM