Cómo Shaip implementó un programa escalable de evaluación de la calidad de la clonación de voz para un cliente de voz con IA.

Desde la calidad de demostración hasta la preparación para su implementación: cómo la evaluación humana estructurada ayudó a un cliente de reconocimiento de voz con IA a cerrar la brecha entre las métricas de laboratorio y el rendimiento en el mundo real.

Clonación de voz

Resumen del proyecto

Los modelos de clonación de voz pueden sonar impresionantes en las demostraciones, pero aún presentan dificultades en el uso real. El cliente necesitaba una forma fiable de medir si su modelo estaba mejorando realmente, especialmente para el inglés de la India, que era un mercado prioritario para su implementación.

Shaip fue contratado para diseñar y gestionar un programa de evaluación humana que pudiera responder a tres preguntas clave de la empresa:

  • ¿Suena natural el habla?
  • ¿Sigue sonando igual que el altavoz original?
  • ¿Es lo suficientemente seguro y fiable para su uso en producción?

En lugar de basarse únicamente en métricas automatizadas, el proyecto utilizó revisores humanos capacitados para evaluar las salidas de audio reales e identificar dónde el modelo aún presentaba deficiencias.

Calidad de clonación de voz

Métricas clave del conjunto de datos

Caso de uso

Evaluación de la calidad de la clonación de voz

Duración del proyecto

12 Semanas

Muestras revisadas

12,400 clips de audio sintetizados

Anotadores desplegados

48 evaluadores de inglés capacitados

Desafíos en la evaluación de la calidad de la síntesis de voz y la clonación de voz.

  • El modelo debía funcionar bien en todos los ámbitos. varios acentos ingleses, especialmente el inglés indio.
  • La calidad del audio debía mejorar de maneras que fueran importantes para los usuarios finales, no solo en términos de métricas de laboratorio.
  • El equipo necesitaba una forma clara de identificar ¿Qué fallaba en la salida de voz?.
  • En ocasiones, con el tiempo, los clips de audio largos perdían la identidad del hablante original.
  • El cliente también necesitaba cheques para seguridad, riesgo de suplantación de identidad y presencia de marcas de agua.

Solución: Marco de evaluación humana para la calidad de voz de la IA

Estrategia de evaluación

Shaip creó un marco de revisión estructurado para evaluar la naturalidad, la claridad, la similitud de la voz, la coherencia y la seguridad.

Revisión humana a gran escala

48 evaluadores capacitados revisaron 12,400 muestras de audio en inglés indio, inglés americano neutro y una subpista en hinglish.

Evaluación en tres partes

  • Los críticos calificaron la naturalidad y la comprensibilidad del sonido de cada clip.
  • Compararon pares de vídeos para identificar qué versión era mejor.
  • Identificaron problemas de calidad recurrentes, como ritmos poco naturales, problemas de tono y desincronización de los altavoces.

Control de calidad

Shaip utilizó tareas de calibración, controles de referencia, revisiones repetidas y supervisión del control de calidad para mantener la coherencia y la fiabilidad de la puntuación.

Ciclo de retroalimentación procesable

Los resultados de cada sprint se incorporaron al proceso de ajuste del cliente, lo que ayudó a que el modelo mejorara a lo largo de varias rondas.

Alcance del proyecto: Idiomas, acentos y cobertura de la revisión

Área <b></b><b></b>
Idioma Inglés
Acentos prioritarios Inglés indio, inglés americano neutro
Cobertura Secundaria Inglés británico, subtítulo en hinglish
Tipos de muestra Clips de referencia cortos, muestras de pocas tomas, discurso de formato largo
Revisar el resultado Calificaciones de calidad, etiquetas de preferencia, etiquetado de problemas
Longitud del compromiso 12 semanas

Resultados: Mejoras cuantificables en la clonación de voz.

  • Clara mejora en la calidad de la voz: La puntuación de calidad general del modelo mejoró de 3.41 a 4.12, lo que demuestra que el habla se volvió más natural y lista para la producción.
  • Mejor coincidencia de altavoces: El sistema mejoró notablemente su capacidad para preservar la voz del hablante original, aumentando la similitud de 0.71 a 0.87.
  • Menos errores perceptibles: Los problemas del habla disminuyeron del 31% de las muestras al inicio del estudio al 11% en la fase final.
  • Inteligibilidad fuerte: La tasa final de errores en las palabras del inglés indio alcanzó el 4.8%, superando el umbral objetivo.
  • Preparación para un despliegue más seguro: La evaluación también confirmó un sólido desempeño en controles de seguridad clave, incluyendo la detección de riesgos de suplantación de identidad y la verificación de marcas de agua.
Lo más importante es que el cliente obtuvo un sistema de evaluación repetible que podía usar no solo para juzgar la calidad del modelo, sino también para mejorarlo continuamente. Lo que comenzó como un programa de revisión técnica se convirtió en una herramienta práctica para la toma de decisiones de los equipos de producto, los equipos de modelado y las partes interesadas en la implementación.
Icono de cita

Shaip nos ayudó a convertir la calidad de audio subjetiva en un programa de mejora cuantificable. Su marco de evaluación nos proporcionó información clara sobre qué corregir, dónde mejorar y cómo avanzar con confianza hacia la producción.

— Líder de producto de voz con IA

★ ★ ★ ★ ★
Icono de cita