Audiotranscriptie en -annotatie in Indiase talen: casestudy over conversationele AI

Ze boden hoogwaardige diensten aan voor het transcriberen en annoteren van audio, om hun AI-gestuurde spraakverwerkingsengine te trainen.

Meertalige conversatie-AI

Projectoverzicht: Het bouwen van een meertalige spraakengine voor Indiase talen 

De opdrachtgever is India's toonaangevende AI-productlaboratorium met een marktpositie in de VS, India, Canada en diverse andere landen. Hun visie is om het menselijk potentieel te vergroten door middel van technologie. Ze hebben meer dan tien jaar ervaring met geavanceerde NLP, wetenschappelijk onderzoek op het gebied van kunstmatige intelligentie, machine learning, analyses, visualisaties en aanverwante technologieën.

Ze verleggen de grenzen van mens-machine-interactie met hun AI-producten, zoals ICOG en Autovox. ICOG is een op AI gebaseerde, gepersonaliseerde, intelligente virtuele leerassistent voor leer- en transformatiedoelen binnen het personeelsbestand, terwijl Autovox een AI-gestuurde spraakassistent is.
Verwerkingsengine voor Indiase talen.

Conversatie-ai

Belangrijkste resultaten: 1,200 uur aan annotaties in 6 talen

Audio getranscribeerd en van aantekeningen voorzien

1,200 Hrs

Nee
Talen

6 (200 uur x 6 talen)

Getranscribeerde en geannoteerde talen

Indiaas Engels, Hindi, Tamil, Telugu, Kannada, Malayalam

Project
Timeline

10 Weken

De uitdaging: deskundige taalkundigen vinden voor audio-annotatie in Indiase talen.

Het gebrek aan toegang tot gekwalificeerde taalkundigen, deskundige data-annotators en de lange doorlooptijd zijn knelpunten geweest in de vooruitgang en acceptatie van conversationele AI. Het vinden van taalkundigen, het transcriberen en annoteren van grote hoeveelheden datasets met de vereiste kwaliteit om AI-functionaliteiten te ontwikkelen, is altijd een tijdrovende en kostbare taak geweest die gekwalificeerde mensen uit verschillende vakgebieden vereist. Ondanks een intern team van annotators ondervonden zij problemen met de tijdige levering en de kwaliteit van de annotatie.

De kritische eisen van de opdrachtgever waren:

  1. Toegang tot kwalitatief goede taalkundigen: Gebrek aan toegang tot deskundige taalkundigen voor Indiase talen zoals Indiaas Engels, Hindi, Tamil, Telugu, Kannada en Malayalam.
  2. Audiotranscriptie en -annotatie: Complexe richtlijnen voor audio-annotatie en -transcriptie met een minimale nauwkeurigheid van 95%.
  3. Gegevenslevering: De transcriptbestanden moeten binnen 10 weken in JSON-formaat worden aangeleverd.

De oplossing: audiotranscriptie en -annotatie door deskundige taalkundigen.

Met onze diepgaande kennis van conversationele AI hebben we de klant geholpen bij het transcriberen en annoteren van de aangeleverde datasets. We hebben hiervoor een team van deskundige taalkundigen en annotatoren ingezet om hun AI-gestuurde spraakverwerkingsengine voor Indiase talen te trainen.

Na een evaluatie van vele leveranciers (waaronder enkele zwaargewichten in de branche) koos de klant voor Shaip vanwege onze expertise in het voltooien van grote conversationele AI-projecten binnen strakke deadlines, en de kwaliteit die we boden tegen concurrerende tarieven.

  1. De richtlijnen voor audiotranscriptie en -annotatie worden gevolgd.
    • Geannoteerd audiotype als spraak en niet-spraak
    • Als het audiotype van het geselecteerde segment is gemarkeerd als spraak, moet het type spraak worden geselecteerd, bijvoorbeeld: heldere spraak, spraak met muziek, spraak met ruis of onverstaanbare spraak.
    • Het geselecteerde spraakfragment moet specifiek worden gelabeld met de taal die de spreker spreekt.
    • De annotator moet de regio's markeren met sprekerlabels. Verschillende sprekers moeten worden aangegeven.
      gemarkeerd met verschillende luidsprekerlabels.
    • De annotator moet het geslacht van de spreker selecteren, bijvoorbeeld man of vrouw.
    • De tekst moet worden weergegeven zoals gesproken in de audio en moet grammaticaal correct zijn.
    • Als het geselecteerde audiotype geen spraak is, moet het een van de volgende labels krijgen: geen spraak, muziek, smakken, adem, hoesten, lachen, beltoon, DTMF, gebrabbel, voertuiggeluid en onderbroken voorgrondgeluid.
    • Alle segmenten in de audio moeten van tags worden voorzien voordat ze naar het systeem kunnen worden geüpload.
  2. Levering van gegevens
    Alle transcriptbestanden werden binnen 10 weken in JSON-formaat aangeleverd, conform de opgegeven metadatavereisten.

Het resultaat: een productiegereed meertalig conversationeel AI-systeem.

De hoogwaardige, van aantekeningen voorziene audiogegevens van taalkundig experts stelden de klant in staat om hun AI-gestuurde spraakverwerkingsengine nauwkeurig te trainen in 6 Indiase talen, namelijk Indiaas Engels, Hindi, Tamil, Telugu, Kannada en Malayalam, binnen de gestelde tijd.

Met de hoogwaardige trainingsdatasets kan de klant een intelligent en robuust spraaksysteem met meertalige mogelijkheden aanbieden dat gebruikmaakt van end-to-end (E2E) en hybride modellen om problemen uit de praktijk op te lossen. Simpel gezegd: het bouwen van conversationele AI (zoals Alexa en Siri) die specifiek is afgestemd op de Indiase consument.

Citaat icoon

We waren aangenaam verrast door Shaips robuuste workflowmanagement, snelle doorlooptijd, hun ervaring met conversationele AI en hun netwerk van deskundige taalkundigen. Bovendien is de prijs-kwaliteitverhouding die ze bieden ongeëvenaard.

★ ★ ★ ★ ★
Citaat icoon