Estudio de caso sobre la recopilación de datos de habla en lenguas indias: 300 horas en hindi, telugu e inglés.
Ofrecían servicios de recopilación, transcripción y anotación de datos de audio de alta calidad para entrenar su suite de voz multilingüe con procesamiento de voz impulsado por IA.
Descripción general del proyecto: Datos de voz para una plataforma de localización de idiomas indios
El cliente desarrolla tecnologías que reducen la barrera lingüística en el mundo digital. El contenido de aplicaciones y portales se puede distribuir en varios idiomas en tiempo real a través de su plataforma de Idioma como Servicio (LaaS). La plataforma de idiomas ofrece contenido estático y dinámico de aplicaciones y portales en varios idiomas en tiempo real.
Ofrecen servicios de localización de idiomas a diversos clientes, como marcas de telefonía móvil, fabricantes de chipsets, empresas de internet para el consumidor, bancos e instituciones financieras, gobiernos, empresas de entretenimiento y más.
Resultados clave: 300 horas recopiladas en 3 idiomas.
Datos de audio recopilados, transcritos y anotados.
Hrs 300
Nº de
Idiomas
3 (100 horas x 3 idiomas)
Idiomas transcritos y anotados
Inglés indio, hindi, telugu
Proyectos
Cronograma
12 Semanas
El reto: obtener habla conversacional demográficamente diversa
La falta de acceso a lingüistas cualificados, anotadores de datos expertos y plazos estrictos ha supuesto un obstáculo para el progreso y la adopción de la IA conversacional. Encontrar lingüistas, transcribir y anotar grandes volúmenes de conjuntos de datos con la calidad necesaria para desarrollar capacidades de IA es una tarea larga y costosa que requiere recursos especializados de diversos ámbitos.
Los requisitos críticos del cliente fueron:
- Acceso a lingüistas cualificados para la recopilación de audio: Reúna 300 horas de audio en idiomas como el inglés indio, el hindi y el telugu, grabados por lingüistas expertos con diversidad demográfica.
- Transcripción y anotación de audio complejas con una precisión mínima del 90%:
- Transcribí los archivos de audio completos, capturando todas las palabras tal como se pronunciaron, incluyendo vacilaciones, palabras de relleno, falsos comienzos y otros tics verbales.
- Se obtuvo un resultado sin errores a pesar de las estrictas directrices de transcripción relacionadas con pronunciaciones dialectales, palabras mal pronunciadas, uso no estándar y puntuación.
- Entrega de datos: Entrega de archivos de audio de alta calidad y diversos, junto con sus transcripciones correspondientes (en formato JSON) en 3 idiomas, en un plazo de 12 semanas.
La solución: recopilación, transcripción y anotación de audio específicas del dominio.
Gracias a nuestro profundo conocimiento de la IA conversacional, ayudamos al cliente a recopilar, transcribir y anotar los datos mediante un equipo de lingüistas y anotadores expertos para entrenar su suite de voz multilingüe basada en IA.
Tras evaluar a numerosos proveedores, el cliente eligió a Shaip por nuestra experiencia en la realización de proyectos de IA conversacional dentro de plazos estrictos, de forma rentable y con la calidad requerida. Su equipo también quedó impresionado con la sólida y completa capacidad de ejecución de proyectos de Shaip.
| Idioma | Número de horas | Conversación general sin guion (50%) | Conversación espontánea en un centro de llamadas (30%) | Contenido multimedia descartado en línea (20%) |
|---|---|---|---|---|
| hindi | 100 | 50 | 30 | 20 |
| Inglés | 100 | 50 | 30 | 20 |
| telégu | 100 | 50 | 30 | 20 |
| Total | 300 | 150 | 90 | 60 |
- Requisito adicional de recopilación de audio
- Frecuencia: Frecuencia de muestreo – 16 kHz
- Formato: WAV
- Duración – Duración general (5-30 minutos) – conversaciones
- Dominio del habla: servicios financieros, telecomunicaciones y comercio minorista.
- Diversidad demográfica: género: proporción 1:1, rango de edad: 18-60, captura de ID de orador para identificar a cada orador único.
- Se siguen las directrices de segmentación, transcripción y anotación de audio.
2.1 Segmentación- Cree segmentos de 15 segundos cada uno (con marca de tiempo en milisegundos) para archivos individuales de más de 30 segundos.
- Tipos de sonido segmentados: habla, balbuceo, música, ruido, superposición.
- Etiquetado de segmentos: hora de inicio, hora de finalización, ID de segmento, nivel de sonoridad, tipo de sonido principal,
código de idioma, identificador de hablante
2.2 Transcripción y anotación- Transcribí los archivos de audio completos, capturando todas las palabras tal como se pronunciaron, incluyendo vacilaciones, palabras de relleno, falsos comienzos y otros tics verbales, como símbolos y caracteres.
- Proporcionó una salida sin errores a pesar de las estrictas pautas de transcripción asociadas con pronunciaciones dialectales, palabras mal pronunciadas, uso no estándar, puntuación, mayúsculas, abreviaturas, contracciones, números, acrónimos, habla disfluente e ininteligible, no objetivo.
idiomas y más.
- Entrega de datos
Todos los archivos de audio WAV y las transcripciones se entregaron en formato JSON, de acuerdo con el perfil demográfico único de los hablantes, en un plazo de 12 semanas.
El resultado: Un conjunto de voces multilingües listo para producción.
Los datos de audio anotados de alta calidad, proporcionados por lingüistas expertos, permitieron al cliente entrenar con precisión su suite de voz multilingüe con procesamiento de voz basada en IA en 3 idiomas: inglés indio, hindi y telugu, dentro del plazo estipulado.
Gracias a los conjuntos de datos de entrenamiento de máxima calidad, el cliente pudo ofrecer servicios inteligentes y robustos de conversión de voz a texto, traducción de idiomas y teclados multilingües para resolver problemas del mundo real.
Nos impresionó la sólida capacidad de ejecución de proyectos de Shaip, así como su experiencia en la obtención, transcripción y anotación de los datos de audio necesarios, provenientes de lingüistas expertos. Sus múltiples controles de calidad, el estricto cumplimiento de los plazos y su excelente relación calidad-precio son inigualables.