Transcripción y anotación de audio en idiomas indios: Estudio de caso de IA conversacional

Ofrecían servicios de transcripción y anotación de audio de alta calidad para entrenar su motor de procesamiento de voz basado en inteligencia artificial.

IA conversacional multilingüe

Descripción general del proyecto: Creación de un motor de reconocimiento de voz multilingüe para lenguas indias. 

El cliente es un laboratorio de productos de IA pionero en la India, con presencia en los mercados de EE. UU., India, Canadá y otros países. Su visión es potenciar el potencial humano mediante la tecnología. Cuentan con más de diez años de experiencia en PNL de vanguardia e investigación científica en inteligencia artificial, aprendizaje automático, análisis de datos, visualizaciones y tecnologías afines.

Están ampliando los límites de la interacción humano-máquina con sus productos de IA, como ICOG y Autovox. ICOG es un asistente virtual de aprendizaje inteligente y personalizado basado en IA, para objetivos de formación y transformación de la fuerza laboral, mientras que Autovox es un sistema de reconocimiento de voz impulsado por IA.
Motor de procesamiento para lenguas indias.

IA conversacional

Resultados clave: 1,200 horas anotadas en 6 idiomas.

Audio transcrito y anotado

Hrs 1,200

Nº de
Idiomas

6 (200 horas x 6 idiomas)

Idiomas transcritos y anotados

Inglés indio, hindi, tamil, telugu, kannada, malayalam

Proyectos
Cronograma

10 Semanas

El reto: Encontrar lingüistas expertos para la anotación de audio en lenguas indias.

La falta de acceso a lingüistas cualificados, anotadores de datos expertos y el tiempo de comercialización han sido un obstáculo para el progreso y la adopción de la IA conversacional. Encontrar lingüistas, transcribir y anotar grandes volúmenes de conjuntos de datos con la calidad necesaria para desarrollar capacidades de IA siempre ha sido una tarea costosa y que consume mucho tiempo, además de requerir recursos especializados de diversos ámbitos. A pesar de contar con un equipo interno de anotadores, se enfrentaban a problemas con la entrega puntual y la calidad de las anotaciones.

Los requisitos críticos del cliente fueron:

  1. Acceso a lingüistas de calidad: Falta de acceso a lingüistas expertos en lenguas indias como el inglés indio, el hindi, el tamil, el telugu, el kannada y el malayalam.
  2. Transcripción y anotación de audio: Directrices complejas para la anotación y transcripción de audio con una precisión mínima del 95 %.
  3. Entrega de datos: Los archivos de transcripción deberán entregarse en formato JSON en un plazo de 10 semanas.

La solución: Transcripción y anotación de audio por lingüistas expertos.

Gracias a nuestro profundo conocimiento de la IA conversacional, ayudamos al cliente a transcribir y anotar los conjuntos de datos proporcionados, aprovechando un equipo de lingüistas y anotadores expertos para entrenar su motor de procesamiento de voz basado en IA para idiomas indios.

Tras evaluar a numerosos proveedores (incluidos algunos pesos pesados ​​del sector), el cliente elige a Shaip por nuestra experiencia en la realización de grandes proyectos de IA conversacional dentro de plazos estrictos y por la calidad que ofrecemos a precios competitivos.

  1. Se siguen las directrices de transcripción y anotación de audio.
    • Tipo de audio anotado como Habla y No habla
    • Si el tipo de audio del segmento seleccionado está marcado como habla, entonces se debe seleccionar el tipo de habla, es decir, Habla limpia, Habla + Música, Habla + Ruido, Habla incomprensible.
    • El segmento de voz seleccionado debe estar etiquetado específicamente con el idioma hablado por el hablante.
    • El anotador debe marcar las regiones con etiquetas de hablante. Se deben identificar diferentes hablantes.
      marcados con diferentes etiquetas de orador.
    • El anotador debe seleccionar el género del hablante, es decir, masculino o femenino.
    • El texto debe estar escrito tal como se escucha en el audio y debe ser gramaticalmente correcto.
    • Si el tipo de audio seleccionado no es de voz, se le debe asignar una de las siguientes etiquetas: sin voz, música, chasquido de labios, respiración, tos, risa, timbre, DTMF, balbuceo, ruido de vehículo y ruido intermitente de primer plano.
    • Todos los segmentos del audio deben estar marcados con etiquetas y solo entonces se pueden cargar al sistema.
  2. Entrega de datos
    Todos los archivos de transcripción se entregaron en formato JSON, de acuerdo con los requisitos de metadatos especificados, en un plazo de 10 semanas.

El resultado: un motor de IA conversacional multilingüe listo para producción.

Los datos de audio anotados de alta calidad, proporcionados por lingüistas expertos, permitieron al cliente entrenar con precisión su motor de procesamiento de voz basado en IA en 6 idiomas indios: inglés indio, hindi, tamil, telugu, kannada y malayalam, dentro del plazo estipulado.

Con conjuntos de datos de entrenamiento de referencia, el cliente podrá ofrecer un sistema de voz inteligente y robusto con capacidad multilingüe que utiliza modelos híbridos y de extremo a extremo (E2E) para resolver problemas del mundo real. En resumen, se trata de crear una IA conversacional (como Alexa o Siri) específicamente adaptada a los consumidores indios.

Icono de cita

Nos sorprendió gratamente la sólida gestión del flujo de trabajo de Shaip, su rápida respuesta, su experiencia en IA conversacional y su red de lingüistas expertos. Además, su excelente relación calidad-precio es inigualable.

★ ★ ★ ★ ★
Icono de cita