Étude de cas sur la collecte de données vocales en langues indiennes : 300 heures en hindi, télougou et anglais

Nous proposons des services de collecte, de transcription et d'annotation de données audio de haute qualité, afin d'entraîner leur suite vocale multilingue de traitement de la parole basée sur l'IA.

IA conversationnelle multilingue pour les langues indiennes

Présentation du projet : Données vocales pour une plateforme de localisation en langue indienne

Le client développe des technologies qui réduisent la fracture linguistique dans le monde numérique. Grâce à sa plateforme de services linguistiques (LaaS), le contenu des applications et des portails peut être diffusé en temps réel dans plusieurs langues. Cette plateforme permet de diffuser en temps réel du contenu statique et dynamique provenant d'applications et de portails dans plusieurs langues.

Ils proposent des services de localisation linguistique à de nombreux clients, tels que des marques de téléphones mobiles, des fabricants de puces, des sites internet grand public, des banques et des institutions financières, des établissements d'enseignement, des gouvernements, des entreprises de divertissement, et bien plus encore.

IA conversationnelle

Résultats clés : 300 heures collectées dans 3 langues

Données audio collectées, transcrites et annotées

Hrs 300

Nombre de
Langues

3 (100 heures x 3 langues)

Langues transcrites et annotées

Anglais indien, hindi, télougou

Projet
Forum

12 Semaines

Le défi : trouver des sources de discours conversationnels démographiquement diversifiés

Le manque d'accès à des linguistes qualifiés, à des annotateurs de données experts et à des délais stricts constitue un frein au développement et à l'adoption de l'IA conversationnelle. Trouver des linguistes, transcrire et annoter de grands volumes de données avec la qualité requise, suffisante pour développer des capacités d'IA, est une tâche longue et coûteuse qui exige des ressources qualifiées issues de divers domaines.

Les exigences critiques du client étaient :

  1. Accès à des linguistes de qualité pour la collecte audio : Collecter 300 heures d'enregistrements audio pour des langues telles que l'anglais indien, l'hindi et le télougou, auprès de linguistes experts issus de divers horizons démographiques.
  2. Transcription et annotation audio complexes avec une précision minimale de 90 % :
    • J'ai transcrit l'intégralité des fichiers audio, en capturant tous les mots prononcés, y compris les hésitations, les mots de remplissage, les faux départs et autres tics de langage.
    • A fourni un résultat sans erreur malgré des directives de transcription strictes liées aux prononciations dialectales, aux mots mal prononcés, à l'usage non standard et à la ponctuation.
  3. Livraison des données: Livraison de fichiers audio de haute qualité et variés, accompagnés des transcriptions correspondantes (format JSON) pour 3 langues, dans un délai de 12 semaines.

La solution : Collecte, transcription et annotation audio spécifiques au domaine

Grâce à notre connaissance approfondie de l'IA conversationnelle, nous avons aidé le client à collecter, transcrire et annoter les données grâce à une équipe d'experts en linguistique et en annotation, afin d'entraîner sa suite vocale multilingue basée sur l'IA.

Après avoir évalué plusieurs fournisseurs, le client a choisi Shaip pour notre expertise dans la réalisation de projets d'IA conversationnelle dans des délais très courts, à un coût avantageux et avec le niveau de qualité requis. Son équipe a également été impressionnée par la capacité de Shaip à mener à bien des projets de manière solide et complète.

Langue Nombre d'heures Conversation générale non scénarisée (50%) Conversation non scénarisée en centre d'appels (30 %) Contenu multimédia en ligne récupéré (20%)
Hindi 100 50 30 20
Anglais 100 50 30 20
Télégu 100 50 30 20
Total 300 150 90 60
  1. Exigence supplémentaire en matière de collecte audio
    • Fréquence : Fréquence d'échantillonnage – 16 kHz
    • Format : WAV
    • Durée – Durée générale (5 à 30 minutes) – conversations
    • Domaine de la parole – Banque, finance et assurance, télécommunications et commerce de détail
    • Diversité démographique – Ratio hommes/femmes : 1:1, Tranche d’âge : 18-60 ans, Capture de l’identifiant du locuteur pour identifier chaque locuteur unique
  2. Les directives relatives à la segmentation audio, à la transcription et à l'annotation ont été respectées.

    2.1 Segmentation
    • Créez des segments de 15 secondes chacun (horodatés à la milliseconde près) pour les fichiers individuels de plus de 30 secondes.
    • Types de sons segmentés – parole, babillage, musique, bruit, chevauchement
    • Étiquetage des segments – heure de début, heure de fin, identifiant du segment, niveau sonore, type de son principal,
      code de langue, identifiant du locuteur


    2.2 Transcription et annotation

    • J'ai transcrit l'intégralité des fichiers audio, en capturant tous les mots prononcés – y compris les hésitations, les mots de remplissage, les faux départs et autres tics verbaux, c'est-à-dire les symboles et les caractères.
    • Fourniture d'un résultat sans erreur malgré des directives de transcription strictes liées aux prononciations dialectales, aux mots mal prononcés, à l'usage non standard, à la ponctuation, aux majuscules, aux abréviations, aux contractions, aux nombres, aux acronymes, à un discours hésitant et inintelligible, et aux éléments non cibles.
      langues, et plus encore.
  3. Livraison de données
    Tous les fichiers audio WAV et les transcriptions ont été livrés au format JSON conformément aux caractéristiques démographiques uniques des intervenants inclus dans les 12 semaines.

Résultat : Une suite vocale multilingue prête à la production

Les données audio annotées de haute qualité, fournies par des linguistes experts, ont permis au client d'entraîner avec précision sa suite vocale multilingue de traitement de la parole basée sur l'IA dans 3 langues, à savoir l'anglais indien, l'hindi et le télougou, dans les délais impartis.

Grâce à des ensembles de données d'entraînement de référence, le client a pu proposer des services intelligents et robustes de transcription vocale, de traduction automatique et de claviers multilingues pour résoudre des problèmes concrets.

Icône de devis

Nous avons été impressionnés par la grande capacité de Shaip à mener à bien des projets, ainsi que par son expertise dans la recherche, la transcription et l'annotation des données audio requises auprès de linguistes experts. Leurs multiples contrôles qualité, le respect rigoureux des délais et leur excellent rapport qualité-prix sont inégalés.

★★★★★
Icône de devis