La mayoría de los equipos de IA física saben que necesitan datos. Pocos saben que necesitan una gran cantidad de ellos. Las capacidades que necesita un robot humanoide, un vehículo autónomo o un robot de almacén —percepción, acción, seguimiento de instrucciones, ejecución de flujos de trabajo de varios pasos— se corresponden con una capa diferente de datos de entrenamiento, con distintos métodos de recopilación, profundidad de anotación y controles de calidad. La pila de conjuntos de datos de IA física permite concebir esas capas como un sistema integrado, en lugar de cuatro decisiones de adquisición desconectadas.

Puntos Clave
- La pila de datos de IA física tiene cuatro capas vinculadas a cuatro capacidades del mundo real.
- La capa 1 abarca la actividad humana y los datos de demostración para la percepción y la comprensión.
- La capa 2 captura los datos de manipulación del robot para la ejecución repetible de tareas.
- La capa 3 alinea la visión, el lenguaje y la acción para el seguimiento de instrucciones a gran escala.
- La capa 4 admite la finalización de tareas a largo plazo y en múltiples pasos en entornos reales.
- Cada capa alimenta a la siguiente; las debilidades de las capas inferiores se propagan hacia arriba en la pila.
¿Por qué pensar en los datos físicos de IA como una pila?
Los datos de IA física se comportan como una pila, ya que cada capa de capacidad depende de las capas inferiores. Los datos de percepción sin datos de acción producen un modelo que ve, pero no puede moverse. Los datos de acción sin alineación de lenguaje producen un modelo que se mueve, pero no puede seguir instrucciones. Los datos de flujo de trabajo a largo plazo sin un seguimiento de instrucciones robusto colapsan en la primera tarea de varios pasos.
El conjunto de datos abiertos de IA física de NVIDIA, publicado para la comunidad de desarrolladores, comprende miles de horas de vídeo multicámara con una diversidad sin precedentes (NVIDIA, 2025), e incluso a esa escala, los equipos posteriores aún necesitan sus propias capas específicas para cada tarea. Los datos de preentrenamiento son necesarios, pero no suficientes.
Capa 1: ¿Qué abarcan los datos de comprensión humana?
Los datos de comprensión humana son datos de actividad y demostración humana: grabaciones en primera y tercera persona de personas realizando tareas en entornos reales. Esto enseña al modelo cómo es el mundo y cómo se mueven los humanos en él.
Datos de demostración humana: Grabaciones de vídeo y de sensores de personas realizando tareas, con anotaciones que relacionan las observaciones con las acciones, las intenciones o los resultados.
Esta capa alimenta la percepción, la comprensión de la escena y la inferencia de intenciones. Preguntas de calidad que se deben formular:
- ¿Los datos abarcan los entornos en los que operará su robot?
- ¿Las demostraciones están anotadas a nivel de acción atómica o solo clip por clip?
- ¿Está documentado y es rastreable el consentimiento de los participantes?
L1 de Shaip de múltiples proveedores Esta capa captura la actividad del mundo real en cocinas, fábricas, almacenes, centros de salud y carreteras, entornos que se ajustan a los contextos de implementación en lugar de a las condiciones de laboratorio.
Capa 2: ¿Qué información abarcan los datos de ejecución de tareas?
Los datos de ejecución de tareas son datos de manipulación del robot: trayectorias, estados de las articulaciones, interacciones con objetos y dinámicas de contacto para tareas físicas repetibles. Le enseñan al modelo cómo actuar, no solo qué percibir.
Datos de manipulación del robot: Secuencias con marca de tiempo de estados del robot, posiciones del efector final e interacciones con objetos, capturadas durante la teleoperación, la ejecución programada o la reproducción de demostraciones.
Aquí es donde entra en juego la estructura específica de cada encarnación. Las configuraciones de las articulaciones, las geometrías de las pinzas y los espacios de acción varían entre los robots, por lo que los datos de manipulación rara vez son transferibles entre encarnaciones sin una reorientación. Los esfuerzos entre encarnaciones, como los conjuntos de datos que unifican 22 encarnaciones de robots bajo un mismo esquema de acción (DeepMind/Stanford et al., 2024), han facilitado un poco este proceso, pero la recopilación de datos de manipulación específicos para cada tarea sigue siendo un proceso manual.
Capa 3: ¿Qué aportan los datos VLA?
Los datos de VLA añaden alineación lingüística a la visión y la acción: cada episodio incluye una instrucción en lenguaje natural vinculada a la trayectoria que la ejecuta.
Datos de Visión-Lenguaje-Acción (VLA): Datos de entrenamiento a nivel de episodio que contienen observaciones visuales sincronizadas, instrucciones en lenguaje natural y trayectorias de acción con etiquetas de éxito.
Esta capa es la que permite seguir instrucciones. Sin ella, un modelo de manipulación puede ejecutar una sola tarea entrenada; con ella, la misma estructura puede generalizarse a través de cientos de instrucciones. La clave está en que las descripciones del lenguaje deben ser atómicas, específicas y alineadas con los límites de las acciones reales, no resúmenes vagos. La precisión de las anotaciones en esta capa determina si un algoritmo de lenguaje virtual (VLA) optimizado se generaliza a nuevas indicaciones o memoriza el conjunto de entrenamiento.
Capa 4: ¿Qué abarcan los datos de tareas a largo plazo?
Los datos de tareas a largo plazo abarcan flujos de trabajo de varios pasos: secuencias en las que el robot debe completar una subtarea para comenzar la siguiente. Cocinar una comida, clasificar un palé en un almacén y ensamblar un kit son ejemplos de tareas a largo plazo. Cada una requiere que el modelo registre el estado, se recupere de fallos en las subtareas y encadene habilidades.
Un conjunto de datos de investigación centrado en la manipulación de mesas a largo plazo comprendía 200 episodios distribuidos en 20 tareas de varios pasos con escenas complejas (autores de LHManip, arXiv, 2024); de escala reducida pero con una estructura rigurosa. Los equipos de producción suelen crear conjuntos de evaluación con cientos o miles de episodios a largo plazo, además de registros de manejo de excepciones para la recuperación ante fallos.
Cómo las cuatro capas alimentan el despliegue
| Capa | Capacidad desbloqueada | Lo que los equipos suelen pasar por alto |
|---|---|---|
| L1 — Comprensión humana | Percepción, intención, contexto de la escena | Entorno compatible con el sitio de implementación |
| L2 — Ejecución de tareas | Manipulación repetible | Dinámica de contacto, recuperación de fallas |
| L3 — Instrucciones siguientes | Generalización entre tareas | Etiquetas de lenguaje atómicas y alineadas con la acción |
| L4 — Finalización del flujo de trabajo | Tareas del mundo real de varios pasos | Manejo de excepciones, seguimiento del estado |
Imagínese un equipo de automatización industrial que domina las capas L1 y L2 (percepción nítida, manipulación fluida en las pruebas), pero omite la capa L3. Su robot recoge cualquier objeto que se le señale, pero no puede seguir una instrucción verbal sin modificar el código. Omitir la capa L4 tiene el mismo efecto: el sistema realiza tareas individuales y luego falla en el segundo paso. Cada capa faltante limita el potencial de implementación.
Certificaciones y cumplimiento normativo para datos físicos de IA
Los programas de IA física se desarrollan en un entorno regulatorio y de adquisiciones cada vez más estricto, especialmente en los ámbitos de la salud, la movilidad autónoma y la seguridad laboral. Los compradores empresariales exigen cada vez más controles estructurados antes de firmar contratos de recopilación o anotación de datos.
- ISO 27001 para la gestión de la seguridad de la información.
- SOC 2 Tipo II para controles de organizaciones de servicios.
- Controles que cumplen con la normativa HIPAA para datos de movimiento clínicos o de rehabilitación.
- Los marcos normativos del RGPD y la CCPA en materia de consentimiento de los participantes y derechos sobre sus datos.
Shaip opera bajo cada uno de estos marcos en todos los programas de colecciones globales. Los compradores pueden revisar los detalles en el página de seguridad y cumplimiento antes de definir el alcance de una interacción física con la IA.
Conclusión: La pila es la estrategia
La pila de conjuntos de datos de IA física no es una lista de verificación de adquisición; es la arquitectura de un sistema desplegable. Los equipos que la tratan como una construcción integrada —la comprensión humana alimenta la manipulación, la manipulación alimenta el seguimiento de instrucciones, todo ello alimenta la ejecución a largo plazo— envían robots que funcionan en el mundo real. Shaip opera como socio de infraestructura de datos en las cuatro capas, incluyendo IA multimodal Flujos de trabajo que conectan la percepción, el lenguaje y la acción en una misma interacción.
¿Cuál es la pila de datos físicos de IA?
La pila de datos de IA física es un marco de cuatro capas que relaciona los tipos de datos de entrenamiento con las capacidades del robot. La capa 1 abarca la actividad humana para la percepción, la capa 2 abarca la manipulación del robot, la capa 3 abarca los datos de visión, lenguaje y acción para el seguimiento de instrucciones, y la capa 4 abarca las tareas de largo plazo de múltiples pasos. Cada capa permite una capacidad de implementación distinta.
¿Es necesario construir siempre las cuatro capas internamente?
No es necesario crear las cuatro capas internamente. Los conjuntos de datos de preentrenamiento públicos cubren gran parte de la Capa 1, y los programas internos o asociados se centran en los datos de ajuste fino selectivo de las Capas 2 a 4. La cuestión clave es si los datos se ajustan al entorno de implementación, no si fueron recopilados internamente.
¿Qué capa es la más subestimada por los equipos de IA física?
La capa 4 —datos de tareas a largo plazo— es la más subestimada. Los equipos suelen crear sólidos sistemas de percepción y manipulación, dando por sentado que la secuenciación se realiza automáticamente. En la práctica, las tareas de varios pasos requieren demostraciones explícitas, seguimientos de manejo de excepciones y conjuntos de evaluación que detecten los modos de fallo de las subtareas. Sin esto, la implementación se estanca en demostraciones de una sola tarea.
¿Cómo se relaciona el conjunto de datos físicos de IA con los modelos VLA?
La pila de datos de IA física se relaciona con los modelos VLA en la capa 3. Los datos de entrenamiento de VLA se ubican en la capa de seguimiento de instrucciones, tomando como base los datos de percepción de la capa 1 y los datos de manipulación de la capa 2. Un VLA bien construido necesita las tres capas inferiores para funcionar; la capa 4 lo extiende a flujos de trabajo del mundo real de varios pasos.
¿Los datos sintéticos forman parte del conjunto de datos?
Los datos sintéticos forman parte de cada capa del conjunto de datos, pero rara vez reemplazan por completo a los datos reales. La generación de datos sintéticos permite escalar eventos poco frecuentes, casos extremos y variantes de implementación. Los datos reales sirven de base para la dinámica de contacto, la transferencia de datos entre la simulación y la realidad, y la interacción humano-robot. Los programas avanzados utilizan ambos tipos de datos, con pruebas de rendimiento que monitorizan la diferencia entre el rendimiento de la simulación y el de la realidad.
¿Cuánto tiempo se tarda en construir la pila completa de datos físicos de IA?
La creación de un conjunto completo de datos físicos para IA suele llevar de meses a años, dependiendo del alcance y la implementación. Los programas de recopilación en diversos entornos son la etapa más larga. Los equipos aceleran el proceso comenzando con datos de ajuste fino de la Capa 3 para una tarea específica, para luego expandirse a flujos de trabajo de la Capa 4 y una cobertura más amplia de la Capa 1 a medida que se estabiliza el caso de uso de la implementación.






