Comment Shaip a mis en œuvre un programme d'évaluation de la qualité du clonage vocal à grande échelle pour un client spécialisé dans la parole IA
De la qualité démo à la mise en production : comment une évaluation humaine structurée a permis à un client vocal IA de combler l’écart entre les mesures de laboratoire et les performances réelles.
Résumé du projet
Les modèles de clonage vocal peuvent paraître impressionnants lors des démonstrations, mais peinent à convaincre en situation réelle. Le client avait besoin d'un moyen fiable de mesurer l'amélioration réelle de son modèle, notamment pour l'anglais indien, marché prioritaire pour son déploiement.
Shaip a été recruté pour concevoir et gérer un programme d'évaluation des ressources humaines capable de répondre à trois questions clés pour l'entreprise :
- Le discours sonne-t-il naturel ?
- Le son est-il toujours identique à celui du haut-parleur d'origine ?
- Est-ce suffisamment sûr et fiable pour une utilisation en production ?
Au lieu de se fier uniquement à des mesures automatisées, le projet a fait appel à des examinateurs humains formés pour évaluer des productions audio réelles et identifier les points faibles du modèle.
Indicateurs clés de l'ensemble de données
Case Study
Évaluation de la qualité du clonage vocal
Durée du projet
12 Semaines
Échantillons examinés
12 400 clips audio synthétisés
Annotateurs déployés
48 évaluateurs anglais formés
Difficultés liées à l'évaluation de la qualité de la synthèse vocale et du clonage vocal
- Le modèle devait bien fonctionner dans tous les domaines plusieurs accents anglais, en particulier l'anglais indien.
- La qualité audio devait s'améliorer sur des points qui importent aux utilisateurs finaux, et pas seulement selon des mesures de laboratoire.
- L'équipe avait besoin d'un moyen clair d'identifier Qu'est-ce qui n'allait pas dans la sortie vocale ?.
- Les longs extraits audio perdaient parfois l'identité de l'orateur d'origine au fil du temps.
- Le client avait également besoin de chèques pour sécurité, risque d'usurpation d'identité et présence de filigrane.
Solution : Cadre d’évaluation humaine de la qualité vocale de l’IA
Stratégie d'évaluation
Shaip a mis au point un cadre d'évaluation structuré pour évaluer le naturel, la clarté, la similarité des voix, la cohérence et la sécurité.
Examen humain à grande échelle
48 évaluateurs formés ont examiné 12 400 échantillons audio en anglais indien, en anglais américain neutre et sur une piste audio secondaire en Hinglish.
Évaluation en trois parties
- Les critiques ont évalué le caractère naturel et compréhensible de chaque extrait sonore.
- Ils ont comparé des paires de clips pour identifier quelle version était la meilleure.
- Ils ont relevé des problèmes de qualité récurrents tels que des rythmes anormaux, des problèmes de tonalité et une dérive des haut-parleurs.
Contrôle Qualité
Shaip a utilisé des tâches d'étalonnage, des contrôles de référence, des examens répétés et un contrôle qualité pour assurer la cohérence et la fiabilité de la notation.
Boucle de rétroaction exploitable
Les résultats de chaque sprint ont été réintégrés dans le processus de réglage du client, contribuant ainsi à l'amélioration du modèle au fil des itérations.
Étendue du projet : Langues, accents et couverture des révisions
| Région | Domaine |
|---|---|
| Langue | Anglais |
| Accents prioritaires | Anglais indien, anglais américain neutre |
| Couverture secondaire | Sous-piste en anglais britannique et en hinglish |
| Types d'échantillons | Courts extraits de référence, échantillons de quelques plans, discours longs |
| Réviser le résultat | Évaluation de la qualité, étiquettes de préférence, étiquetage des problèmes |
| Durée des fiançailles | 12 semaines |
Résultats : Améliorations mesurables du clonage vocal
- Amélioration nette de la qualité vocale : Le score de qualité global du modèle est passé de 3.41 à 4.12, ce qui montre que la parole est devenue plus naturelle et prête pour la production.
- Meilleure correspondance des haut-parleurs : Le système est devenu bien meilleur pour préserver la voix du locuteur original, améliorant la similarité de 0.71 à 0.87.
- Moins d'erreurs visibles : Les problèmes d'élocution sont passés de 31 % des échantillons au départ à 11 % lors du sprint final.
- Forte intelligibilité : Le taux d'erreur final sur les mots pour l'anglais indien a atteint 4.8 %, dépassant ainsi le seuil cible.
- Préparation au déploiement plus sûre : L'évaluation a également confirmé d'excellents résultats aux principaux contrôles de sécurité, notamment le dépistage des risques d'usurpation d'identité et la vérification des filigranes.
Shaip nous a aidés à transformer notre évaluation subjective de la qualité audio en un programme d'amélioration mesurable. Son cadre d'évaluation nous a clairement indiqué les points à corriger, les axes d'amélioration et la manière d'aborder la production avec confiance.
— Responsable produit IA vocale