Comment Shaip a mis en œuvre un programme d'évaluation de la qualité du clonage vocal à grande échelle pour un client spécialisé dans la parole IA

De la qualité démo à la mise en production : comment une évaluation humaine structurée a permis à un client vocal IA de combler l’écart entre les mesures de laboratoire et les performances réelles.

Clonage de voix

Résumé du projet

Les modèles de clonage vocal peuvent paraître impressionnants lors des démonstrations, mais peinent à convaincre en situation réelle. Le client avait besoin d'un moyen fiable de mesurer l'amélioration réelle de son modèle, notamment pour l'anglais indien, marché prioritaire pour son déploiement.

Shaip a été recruté pour concevoir et gérer un programme d'évaluation des ressources humaines capable de répondre à trois questions clés pour l'entreprise :

  • Le discours sonne-t-il naturel ?
  • Le son est-il toujours identique à celui du haut-parleur d'origine ?
  • Est-ce suffisamment sûr et fiable pour une utilisation en production ?

Au lieu de se fier uniquement à des mesures automatisées, le projet a fait appel à des examinateurs humains formés pour évaluer des productions audio réelles et identifier les points faibles du modèle.

Qualité de clonage vocal

Indicateurs clés de l'ensemble de données

Case Study

Évaluation de la qualité du clonage vocal

Durée du projet

12 Semaines

Échantillons examinés

12 400 clips audio synthétisés

Annotateurs déployés

48 évaluateurs anglais formés

Difficultés liées à l'évaluation de la qualité de la synthèse vocale et du clonage vocal

  • Le modèle devait bien fonctionner dans tous les domaines plusieurs accents anglais, en particulier l'anglais indien.
  • La qualité audio devait s'améliorer sur des points qui importent aux utilisateurs finaux, et pas seulement selon des mesures de laboratoire.
  • L'équipe avait besoin d'un moyen clair d'identifier Qu'est-ce qui n'allait pas dans la sortie vocale ?.
  • Les longs extraits audio perdaient parfois l'identité de l'orateur d'origine au fil du temps.
  • Le client avait également besoin de chèques pour sécurité, risque d'usurpation d'identité et présence de filigrane.

Solution : Cadre d’évaluation humaine de la qualité vocale de l’IA

Stratégie d'évaluation

Shaip a mis au point un cadre d'évaluation structuré pour évaluer le naturel, la clarté, la similarité des voix, la cohérence et la sécurité.

Examen humain à grande échelle

48 évaluateurs formés ont examiné 12 400 échantillons audio en anglais indien, en anglais américain neutre et sur une piste audio secondaire en Hinglish.

Évaluation en trois parties

  • Les critiques ont évalué le caractère naturel et compréhensible de chaque extrait sonore.
  • Ils ont comparé des paires de clips pour identifier quelle version était la meilleure.
  • Ils ont relevé des problèmes de qualité récurrents tels que des rythmes anormaux, des problèmes de tonalité et une dérive des haut-parleurs.

Contrôle Qualité

Shaip a utilisé des tâches d'étalonnage, des contrôles de référence, des examens répétés et un contrôle qualité pour assurer la cohérence et la fiabilité de la notation.

Boucle de rétroaction exploitable

Les résultats de chaque sprint ont été réintégrés dans le processus de réglage du client, contribuant ainsi à l'amélioration du modèle au fil des itérations.

Étendue du projet : Langues, accents et couverture des révisions

Région Domaine
Langue Anglais
Accents prioritaires Anglais indien, anglais américain neutre
Couverture secondaire Sous-piste en anglais britannique et en hinglish
Types d'échantillons Courts extraits de référence, échantillons de quelques plans, discours longs
Réviser le résultat Évaluation de la qualité, étiquettes de préférence, étiquetage des problèmes
Durée des fiançailles 12 semaines

Résultats : Améliorations mesurables du clonage vocal

  • Amélioration nette de la qualité vocale : Le score de qualité global du modèle est passé de 3.41 à 4.12, ce qui montre que la parole est devenue plus naturelle et prête pour la production.
  • Meilleure correspondance des haut-parleurs : Le système est devenu bien meilleur pour préserver la voix du locuteur original, améliorant la similarité de 0.71 à 0.87.
  • Moins d'erreurs visibles : Les problèmes d'élocution sont passés de 31 % des échantillons au départ à 11 % lors du sprint final.
  • Forte intelligibilité : Le taux d'erreur final sur les mots pour l'anglais indien a atteint 4.8 %, dépassant ainsi le seuil cible.
  • Préparation au déploiement plus sûre : L'évaluation a également confirmé d'excellents résultats aux principaux contrôles de sécurité, notamment le dépistage des risques d'usurpation d'identité et la vérification des filigranes.
Plus important encore, le client a bénéficié d'un système d'évaluation reproductible lui permettant non seulement de juger la qualité des modèles, mais aussi de l'améliorer en continu. Ce qui avait commencé comme un programme d'analyse technique est devenu un outil pratique d'aide à la décision pour les équipes produit, les équipes de modélisation et les parties prenantes du déploiement.
Icône de devis

Shaip nous a aidés à transformer notre évaluation subjective de la qualité audio en un programme d'amélioration mesurable. Son cadre d'évaluation nous a clairement indiqué les points à corriger, les axes d'amélioration et la manière d'aborder la production avec confiance.

— Responsable produit IA vocale

★★★★★
Icône de devis