IA multimodal: La guía completa para el entrenamiento de datos, modelos y casos de uso.

Índice

Descargar eBook

IA multimodal

Introducción a la IA multimodalEl mercado de IA multimodal estaba valorado en 2.51 millones de dólares en 2025 y se prevé que alcance los 42.38 millones de dólares en 2034, con una tasa de crecimiento anual compuesta del 36.92%, según Investigación de precedenciaEse crecimiento no se debe únicamente a algoritmos más inteligentes. Se debe a mejores datos de entrenamiento de IA multimodal.

Sin embargo, la mayoría de los equipos subestiman lo que realmente implica recopilar estos datos. Lo tratan como una simple tarea de etiquetado. Pero no lo es. Se trata de un desafío de coordinación: múltiples tipos de datos recopilados de forma sincronizada, anotados con esquemas consistentes y alineados entre las distintas modalidades antes de que un modelo siquiera vea un solo ejemplo.

En Shaip, ahora parte del ecosistema Ubiquity, colaboramos con equipos de IA en la creación de conjuntos de datos que abarcan texto, voz, imagen, vídeo, sensores e imágenes médicas. Los patrones que distinguen a los modelos multimodales de alto rendimiento de los costosos fallos se reducen a decisiones tempranas sobre la calidad de los datos, decisiones que esta guía explica detalladamente.

Al final de este artículo, comprenderá cómo aprenden los modelos multimodales, de dónde obtienen su ventaja los modelos líderes en 2026, qué industrias están implementando la IA multimodal a gran escala con resultados verificados y cómo obtener exactamente los datos que la hacen funcionar.

¿Qué son los datos de entrenamiento de IA multimodal?

Datos de entrenamiento de IA multimodal Un conjunto de datos multimodal es una colección estructurada de entradas emparejadas o intercaladas de dos o más modalidades de datos (como imágenes con subtítulos, grabaciones de audio con transcripciones o vídeo con lecturas de sensores sincronizadas) que se utiliza para entrenar modelos de IA para que comprendan y razonen conjuntamente a través de dichas modalidades. A diferencia de los conjuntos de datos unimodales, que entrenan modelos con un solo tipo de datos, los conjuntos de datos multimodales requieren una alineación intermodal: cada ejemplo debe transmitir un significado coherente en todas las modalidades presentes.

La distinción importa en la práctica. Un modelo solo de texto entrenado con notas clínicas aprende a predecir diagnósticos a partir de palabras. Un modelo multimodal entrenado con notas clínicas y Los datos de imagen correspondientes pueden detectar patrones que ninguna de las dos modalidades revela por sí sola. Esta combinación requiere un enfoque fundamentalmente diferente para la recopilación, anotación y control de calidad de los datos.

De Shaip datos de entrenamiento multimodal Los servicios abarcan seis modalidades principales:

Modalidad Ejemplos Casos de uso principal
Texto Documentos, transcripciones, indicaciones Másteres en Derecho, Procesamiento del Lenguaje Natural, IA de documentos
Imagen Fotografías, escáneres médicos, imágenes satelitales Visión por computadora, diagnóstico
Audio Voz, sonidos ambientales, música ASR, análisis de sentimiento, IA de voz
Vídeo Vigilancia, demostraciones de productos, procedimientos médicos Reconocimiento y seguimiento de acciones
Sensor / LiDAR IMU, radar, sensores de profundidad Vehículos autónomos, robótica
Imagenes medicas Tomografía computarizada, resonancia magnética, DICOM, rayos X IA clínica, radiología

Unimodal vs. Multimodal: una visión general

Unimodal frente a multimodal

La transición de la IA monomodo a la multimodal representa un avance tecnológico significativo. Los primeros sistemas de IA eran altamente especializados: los clasificadores de imágenes podían identificar objetos, pero no comprender las descripciones textuales asociadas, mientras que los procesadores de lenguaje natural podían analizar sentimientos, pero pasaban por alto las señales visuales que proporcionaban un contexto crucial.

Factor Unimodal Multimodal
Tipos de datos Uno (por ejemplo, solo texto) Dos o más, emparejados
Ejemplos de modelos GPT-4 (texto), DALL-E (imagen) GPT-4o, Gemini 2.5, Llama 4
Complejidad de anotación Media Alto (se requiere consistencia intermodal)
Casos de uso Tareas de PLN, clasificación de imágenes Diagnóstico, sistemas autónomos, RAG
Volumen de datos necesario Alto Muy alto (10 veces más por modalidad)

Comprender qué son los datos multimodales is Esto sienta las bases para comprender cómo los modelos lo utilizan realmente, que es donde la mayoría de los equipos se encuentran con las primeras sorpresas desagradables.

Cómo aprenden realmente los modelos de IA multimodales

Cómo funciona la IA multimodal

Todos los modelos multimodales se ejecutan en el mismo proceso de tres etapas: codificación, fusión y decodificación. Lo que sucede en cada etapa determina el tipo de datos de entrenamiento necesarios.

Etapa 1: Codificadores: Conversión de datos brutos en vectores

Cada modalidad ingresa a través de un codificador especializado que convierte la entrada sin procesar en una representación numérica. Un codificador de visión (generalmente una red convolucional o Vision Transformer) convierte una imagen en un vector de características. Un codificador de texto, generalmente basado en transformadores, hace lo mismo con el texto. Un codificador de audio procesa patrones de frecuencia del habla o el sonido.

Estos codificadores pueden entrenarse desde cero o inicializarse a partir de modelos preentrenados como CLIP de OpenAI, que aprende un espacio de incrustación compartido para imágenes y texto mediante el entrenamiento con 400 millones de pares de imagen-leyenda. La calidad de tus datos de entrenamiento en esta etapa determina qué tan bien se generaliza cada codificador a tu dominio.

Etapa 2: Fusión: donde el modelo desarrolla una comprensión intermodal.

La fusión es donde realmente se produce el aprendizaje multimodal. El modelo tiene que conciliar las representaciones vectoriales de diferentes modalidades en una única representación. Existen cuatro estrategias principales:

  • Fusión temprana: Las señales de entrada sin procesar se combinan antes de la codificación. Es un proceso sencillo, pero sensible al ruido en cualquiera de las modalidades.
  • Fusión tardía: Cada modalidad se codifica por separado y se combina en la capa de decisión. Es más robusto, pero puede pasar por alto relaciones intermodales sutiles.
  • Fusión híbrida: Una combinación de ambos, procesando algunas modalidades de forma conjunta y otras de forma independiente.
  • Fusión dinámica (adaptativa): El modelo aprende a ponderar cada modalidad en función de la calidad de entrada en el momento de la inferencia. Si el audio es ruidoso, el modelo reduce su ponderación automáticamente. Este enfoque, cubierto en trabajos recientes de Análisis de Encord para ICLR 2026Ahora se considera una buena práctica para las implementaciones en producción.

[NOTA: La atención intermodal es el mecanismo que hace que la fusión sea precisa. Demostrada originalmente en la arquitectura ViLBERT (Lu et al., 2019) y perfeccionada en CLIP y ALIGN, funciona calculando puntuaciones de atención entre tokens de diferentes modalidades; por ejemplo, alineando la palabra "grieta" en un informe de mantenimiento con la región específica de una imagen de rayos X donde aparece una fractura. La calidad de los datos de entrenamiento determina directamente la precisión con la que se forman estas relaciones de atención.]

Etapa 3: Decodificador — Generación de resultados

El decodificador genera la salida del modelo: una respuesta de texto, un cuadro delimitador, una etiqueta de clasificación o una imagen generada. Para que el decodificador sea fiable, la capa de fusión debe haber visto suficientes ejemplos correctamente alineados durante el entrenamiento para aprender asociaciones intermodales estables.

Esto tiene una implicación directa para su conjunto de datos: los pares mal alineados —un clip de audio emparejado con la transcripción incorrecta, o una imagen con la descripción de una escena diferente— corrompen el aprendizaje de la capa de fusión. Un ejemplo mal etiquetado en un conjunto de datos emparejados causa más daño que un ejemplo mal etiquetado en uno unimodal, porque induce a error a dos modalidades simultáneamente.

De Shaip anotación y etiquetado de datos El proceso incluye comprobaciones de coherencia multimodal en cada etapa precisamente por este motivo.

Panorama de los modelos de IA multimodales para 2026

¿Qué modelos de IA utilizan datos de entrenamiento multimodales? Todos los modelos de base líderes lanzados desde 2023 son multimodales de forma nativa o incorporan activamente nuevas modalidades. GPT-4o, Gemini 2.5, Claude 3.7 Sonnet, Llama 4 Scout y Maverick, y Phi-4 procesan al menos dos modalidades de forma nativa. Para optimizar cualquiera de ellos en tareas específicas de un dominio, se requieren datos de entrenamiento multimodales específicos de dicho dominio, y ahí reside la clave de su ventaja competitiva.

Así es como se desglosa el panorama de 2026 por modalidad y sus implicaciones para los datos de capacitación:

Modelo Developer Modalidades básicas Información clave sobre datos de capacitación
GPT-4o OpenAI Texto, imagen, audio (nativo) Pares de visión-lenguaje; el audio nativo requiere datos de alineación de voz-texto.
Géminis 2.5 Pro Google DeepMind Texto, imagen, vídeo, audio, código Entrenado con datos multimodales intercalados; con gran dominio de tareas de vídeo y texto con contexto extenso.
Soneto de Claudio 3.7 Antrópico Texto, imagen (documentos, gráficos) Optimizado para casos de uso de IA en documentos; especialmente eficaz con pares estructurados de imagen y texto.
Llama 4 Scout / Maverick Meta Texto, imagen (entrelazados) Peso abierto; utiliza entrenamiento intercalado de imágenes y texto (como en Flamingo).
fi-4 Microsoft Texto, imagen, audio. Diseñado para su implementación en el borde de la red; inferencia multimodal eficiente a partir de conjuntos de datos compactos.
Qwen2.5-VL Alibaba Texto, imagen, vídeo Gran capacidad de comprensión visual; ampliamente adoptada para el ajuste fino de código abierto.

El panorama de los modelos está cambiando rápidamente. Notas de ByteByteGo, la era de los modelos solo de texto terminó efectivamente en 2025. Para 2026, Aproximadamente el 60% de las aplicaciones empresariales se construyen utilizando modelos que combinan dos o más modalidades..

Esto significa para su equipo: el modelo en sí se está convirtiendo cada vez más en un producto básico. El factor diferenciador son los datos de entrenamiento específicos del dominio. Un modelo general ajustado con 50 000 ejemplos multimodales de alta calidad y alineados con el dominio de su sector superará sistemáticamente a un modelo general utilizado sin ajustes adicionales.

Datos de capacitación multimodal por sector industrial

Las distintas industrias requieren diferentes combinaciones de modalidades. A continuación, presentamos cinco sectores verticales donde la IA multimodal ha pasado de la fase piloto a la producción, con implementaciones públicas verificadas.

1. Atención médica: Combinación de imágenes, notas clínicas y habla.

Atención sanitaria: revolucionando el diagnóstico y el tratamiento

DeepMind de Google Med-Géminis (2024) demostró lo que sucede cuando los datos de entrenamiento multimodal se realizan correctamente a gran escala. Publicado en Nature En 2024, Saab et al. realizaron una investigación que demostró que un modelo multimodal entrenado con imágenes médicas, notas clínicas e historial del paciente superó significativamente a los modelos de referencia unimodales en 14 parámetros médicos de referencia, incluida la generación de informes radiológicos y el análisis de imágenes patológicas.

Los requisitos de datos de entrenamiento son estrictos: los datos de imágenes deben cumplir con el estándar DICOM, los registros de pacientes deben anonimizarse según los estándares HIPAA y los datos de voz de los dictados médicos deben transcribirse con precisión de vocabulario médico. datos de formación en atención médica El catálogo proporciona conjuntos de datos anonimizados y que cumplen con la normativa HIPAA, que abarcan datos de tomografía computarizada, rayos X, resonancia magnética, dictados médicos y registros médicos electrónicos, diseñados específicamente para equipos que entrenan modelos de IA clínica.

2. Vehículos autónomos y robótica: fusión de sensores a gran escala

Vehículos autónomos y robótica: fusión de sensores a gran escala

El sistema de conducción totalmente autónoma de Tesla utiliza datos de ocho cámaras, sensores ultrasónicos y un radar frontal, procesando todas las señales simultáneamente para tomar decisiones de conducción en tiempo real. El conjunto de datos de entrenamiento se basa en millones de kilómetros recorridos en carretera, con anotaciones a nivel de fotograma en cada señal de los sensores.

Waymo y Boston Dynamics (en colaboración con Google DeepMind en Gemini Robotics, anunciado en el CES 2026) se basan en la fusión de LiDAR, cámara e IMU. Como señaló Jensen Huang en el CES 2026, la IA física —robots que combinan visión, lenguaje y comprensión sensorial— representa la próxima gran frontera multimodal.

El denominador común es que estos sistemas fallan cuando las modalidades de los sensores no están sincronizadas con una precisión inferior al milisegundo en los datos de entrenamiento. La desalineación temporal entre los fotogramas de la cámara y los barridos LiDAR crea artefactos fantasma que el modelo aprende como características reales.

3. Comercio minorista y comercio electrónico: la búsqueda visual se une al lenguaje natural.

Minorista y comercio electrónico

StyleSnap, el producto de búsqueda visual de Amazon, combina la incrustación de imágenes con el procesamiento de consultas de texto para relacionar la foto subida por el cliente con los artículos del catálogo. Los datos de entrenamiento requieren ejemplos de imágenes y texto emparejados donde las descripciones visuales y textuales sean semánticamente equivalentes, no solo que coincidan por palabras clave.

Cuando las imágenes de los productos se anotan con atributos estructurados (color, material, silueta, época del estilo) y se combinan con consultas de búsqueda reales de los clientes, la precisión de la conversión mejora sustancialmente. Este es un problema de Recopilación de datos de IA Calidad, no arquitectura modelo.

4. Experiencia del cliente: Voz, texto y análisis de sentimientos combinados

Experiencia del cliente Los sistemas de IA para centros de contacto están pasando de chatbots basados ​​únicamente en texto a modelos multimodales que procesan simultáneamente la palabra hablada, la transcripción y el tono emocional. Que un cliente diga "esto está bien" con un tono monótono y apagado no es lo mismo que decirlo con entonación ascendente. Los sistemas basados ​​solo en texto no captan esta distinción.

Para crear datos de entrenamiento eficaces para este caso de uso, se requieren grabaciones de audio con sus correspondientes transcripciones, etiquetas de emociones, etiquetas de intenciones y metadatos contextuales, todo ello anotado de forma consistente. La complejidad de la anotación es aproximadamente tres veces mayor que la de la clasificación de intenciones basada únicamente en texto.

5. Inteligencia artificial y gestión empresarial: El sector vertical de mayor crecimiento en 2026

Inteligencia artificial y gestión empresarial: el sector vertical de mayor crecimiento en 2026. La IA aplicada a documentos es el caso de uso multimodal menos documentado en la mayoría de las guías publicadas, y es la categoría de implementación empresarial de más rápido crecimiento. Combina el diseño de PDF, imágenes incrustadas, texto OCR y campos estructurados para automatizar el procesamiento de facturas, la revisión de contratos, la evaluación de riesgos hipotecarios y el cumplimiento normativo.

Microsoft Azure Document Intelligence y AWS Textract son las plataformas más utilizadas, pero ambas requieren ajustes específicos para cada dominio con el fin de funcionar correctamente en formatos de documentos no estándar. Los datos de entrenamiento para este caso de uso combinan documentos escaneados (imagen), texto extraído (OCR), anotaciones estructurales (cuadros delimitadores para los campos) y etiquetas semánticas (este campo es "total de la factura", no "subtotal del artículo").

De Shaip catálogo de datos de visión por computadora Incluye conjuntos de datos de imágenes de documentos anotados para el análisis de formularios y la comprensión del diseño en diferentes tipos de documentos financieros, legales y sanitarios.

Desafíos clave en los datos de entrenamiento de IA multimodal

Escasez y desequilibrio de datos

La recopilación y anotación de datos multimodales alineados de alta calidad es costosa. La escasez no se limita al volumen total, sino que radica en la falta de ejemplos emparejados, equilibrados y representativos para la tarea empresarial específica. Estudios recientes de evaluación comparativa demuestran que el desequilibrio multimodal es ahora un subcampo reconocido, ya que las modalidades dominantes pueden suprimir la señal de las más débiles.

Alineación y sincronización

La alineación multimodal sigue siendo uno de los principales obstáculos en ingeniería. En vídeo, el audio debe coincidir con el rango de fotogramas correcto. En la IA de documentos, las regiones de diseño deben corresponderse correctamente con el texto y las etiquetas. En el sector sanitario, las imágenes deben alinearse con los informes y los registros estructurados. Los estudios sobre alineación y fusión multimodal siguen destacando la alineación como un desafío fundamental.

Modalidades faltantes o imperfectas

Los sistemas empresariales reales rara vez reciben datos completos en todo momento. Los sensores fallan. Las llamadas tienen audio con ruido. Los vídeos pueden carecer de transcripciones. Estudios recientes sobre condiciones de datos imperfectas demuestran que la falta de datos, la corrupción de datos y la mala alineación de las modalidades siguen siendo una limitación práctica para el rendimiento en entornos reales.

Sesgo y equidad en las distintas modalidades

El sesgo no desaparece en los sistemas multimodales, sino que se agrava. Un estudio de 2024 sobre equidad y sesgo en la IA multimodal señala que la investigación sobre sesgo en los grandes modelos multimodales sigue estando menos desarrollada que la investigación sobre sesgo en los modelos de lógica descriptiva, incluso a medida que se expande su uso en el mundo real.

Cómo funcionan los datos de entrenamiento de IA multimodal

Un sistema multimodal robusto suele incluir cinco capas:

1. Recopilación de datos

Recopile recursos sin procesar de todas las modalidades relevantes para el caso de uso, como imagen-texto, audio-texto, vídeo-audio-texto o documento-imagen-texto. Los grandes proyectos de código abierto están creciendo rápidamente: E-MM1 de Encord describe 107 millones de grupos en cinco modalidades, mientras que NVIDIA destacó recientemente un conjunto de datos multimodales de código abierto de 1,700 horas para la IA física.

2. Alineación

Esta es la parte difícil. Los archivos deben corresponderse en el nivel correcto de objeto, tiempo o documento. La alineación y la fusión siguen siendo desafíos técnicos importantes en el aprendizaje automático multimodal, y una mala alineación degrada tanto la calidad del entrenamiento como la recuperación posterior.

3. Anotación

La anotación debe capturar no solo las etiquetas dentro de una modalidad, sino también las relaciones entre modalidades:

  • Coherencia entre imagen y pie de foto
  • mapeo de orador a transcripción
  • marcas de tiempo de fotograma a evento
  • diseño del documento más texto extraído
  • Instrucciones intermodales y resultados esperados

4. Control de calidad

Los controles de calidad deben validar la sincronización, la integridad, los derechos, la precisión lingüística y la coherencia de las etiquetas entre las distintas modalidades. Un estudio reciente sobre la clasificación de la calidad de los datos multimodales demuestra que ya se están utilizando métodos semisintéticos para gestionar corpus multimodales de mayor calidad a gran escala.

5. Evaluación

Los equipos de producción deben evaluar:

  • Precisión de la recuperación multimodal
  • calidad de la puesta a tierra
  • tasa de alucinaciones
  • robustez ante modalidades faltantes
  • equidad entre grupos demográficos y contextos

Cómo funcionan los datos de entrenamiento de IA multimodal

Datos de entrenamiento de IA multimodal: Requisitos clave de calidad

Dimensión de calidad Lo que significa POR QUÉ ES IMPORTANTE
Alineación intermodal Audio, vídeo, texto y datos de sensores sincronizados con una tolerancia inferior a 100 ms. La desalineación produce errores sistemáticos en la capa de fusión.
Diversidad de modalidades Cobertura en todos los grupos demográficos, geográficos, lingüísticos y ambientales. Evita el sesgo compuesto entre diferentes modalidades.
Consistencia de las anotaciones Los anotadores capacitados aplican el mismo esquema semántico en todas las modalidades. Las etiquetas inconsistentes producen representaciones intermodales incoherentes.
Cobertura de casos excepcionales Eventos raros y modos de falla representados explícitamente Los modelos sin entrenamiento para casos extremos fallan silenciosamente en producción.
Cumplimiento de privacidad Información personal identificable eliminada o sintetizada; consentimiento documentado. Exposición regulatoria bajo el RGPD, HIPAA y la Ley de IA de la UE.
Linaje y procedencia Documentación completa de la fuente, método de recopilación y versión de anotación. Obligatorio para la auditabilidad según las obligaciones del artículo 10 de la Ley de IA de la UE.
Calidad de clave de IA multimodal

Cómo Shaip admite datos de entrenamiento de IA multimodal a gran escala

Shaip ofrece servicios de datos multimodales integrales, desde la recopilación y anotación personalizadas hasta conjuntos de datos con licencia listos para usar, brindando soporte a equipos de IA empresariales en los sectores de salud, tecnología y comercio electrónico. Nuestra plataforma de IA generativa gestiona flujos de trabajo de anotación multimodal, la preparación de datos para el ajuste fino y las canalizaciones RLHF en modalidades de texto, voz, imagen, video e imágenes médicas.

Las capacidades clave incluyen:

  • Anotación de conjuntos de datos multimodales en más de 65 idiomas para modalidades de voz y texto.
  • Catálogo de datos médicos que incluye audio de dictados médicos, registros transcritos, conjuntos de datos de rayos X y tomografías computarizadas, y datos estructurados de historias clínicas electrónicas.
  • Servicios personalizados de recopilación de datos para conjuntos de datos emparejados de audio y vídeo, vídeo y texto, y documentos e imágenes.
  • Canales de retroalimentación humana y de RLHF para el ajuste fino de modelos fundamentales multimodales
  • Flujos de trabajo que priorizan el cumplimiento normativo, con anonimización, gestión del consentimiento y documentación completa del linaje de datos.

Para las empresas que desarrollan IA multimodal a gran escala, asociarse con un proveedor de datos especializado acelera los plazos de desarrollo y garantiza la calidad de anotación que requieren las capas de fusión multimodal. Explore las soluciones de datos de entrenamiento de IA multimodal de Shaip o póngase en contacto con nuestro equipo para analizar su caso de uso.

Hablemos

  • Este campo es para fines de validación y debe dejarse sin cambios.
  • Al registrarme, estoy de acuerdo con Shaip Política de privacidad y Términos de Servicio y dar mi consentimiento para recibir comunicaciones de marketing B2B de Shaip.

Preguntas frecuentes

La IA multimodal es un sistema de inteligencia artificial que puede procesar y comprender más de un tipo de datos —como texto, imágenes, audio y vídeo— al mismo tiempo, en lugar de procesar solo uno.

La IA convencional trabaja con un solo tipo de datos a la vez. La IA multimodal combina varios tipos de datos, lo que le proporciona una visión más completa, de forma similar a como los humanos utilizamos la vista, el oído y la lectura simultáneamente para comprender el mundo.

El modelo solo puede aprender lo que se le muestra. Si los datos de entrenamiento están incompletos, desalineados o sesgados, el modelo producirá resultados deficientes, independientemente de lo avanzada que sea su arquitectura. La calidad de los datos determina la calidad del modelo.

Los tipos de datos más comunes son texto, imágenes, audio, vídeo, documentos y datos de sensores. El requisito fundamental es que estos tipos de datos estén emparejados y alineados, no recopilados por separado.

Los datos alineados implican que cada muestra de entrenamiento tenga información coincidente en todas las modalidades. Por ejemplo, un videoclip, su pista de audio y una descripción de texto deben referirse al mismo momento y tener el mismo significado.

No del todo. Los datos sintéticos son útiles para completar información faltante y cubrir escenarios poco comunes, pero los modelos entrenados solo con datos sintéticos tienden a degradarse con el tiempo. Una combinación de datos sintéticos y datos reales anotados por humanos ofrece los mejores resultados.

Recopilar datos multimodales y correctamente alineados es la parte más difícil. A diferencia del texto, que abunda en internet, los datos audiovisuales y textuales emparejados rara vez existen en la práctica y, por lo general, deben crearse deliberadamente.

La técnica de eliminación de modalidades consiste en eliminar aleatoriamente uno o más tipos de datos durante el entrenamiento. Esto permite que el modelo siga funcionando razonablemente bien incluso cuando falta una modalidad en su uso real, en lugar de fallar por completo.

Mediante pruebas de referencia como MMMU (para la comprensión de la visión y el lenguaje) y Video-MME (para tareas de vídeo). También es importante comprobar si se producen alucinaciones, es decir, casos en los que el modelo describe elementos que no están presentes en la entrada.

Actualmente, los sectores de la salud, los vehículos autónomos, el comercio minorista y los servicios financieros son los que presentan los mejores resultados. Cualquier industria donde las decisiones dependan de más de un tipo de información es una candidata idónea para la IA multimodal.