Casestudy over het verzamelen van spraakgegevens in Indiase talen: 300 uur aan spraakopnames in het Hindi, Telugu en Engels.

Ze boden hoogwaardige diensten aan voor het verzamelen, transcriberen en annoteren van audiogegevens, om hun AI-gestuurde spraakverwerkingssysteem voor meertalige spraak te trainen.

Meertalige conversationele AI voor Indiase talen

Projectoverzicht: Spraakdata voor een platform voor taallokalisatie in India

De klant ontwikkelt technologieën die de taalbarrière in de digitale wereld overbruggen. Content van apps en portals kan via hun Language-as-a-Service-platform in realtime in meerdere talen worden aangeboden. Het taalplatform levert statische en dynamische content van apps en portals in meerdere talen in realtime.

Ze bieden taallokalisatie aan voor een breed scala aan klanten, zoals mobiele merken, chipfabrikanten, internetbedrijven, banken en financiële instellingen, onderwijsinstellingen, overheden, de entertainmentindustrie en meer.

Conversatie-ai

Belangrijkste resultaten: 300 uur verzameld in 3 talen

Audiogegevens verzameld, getranscribeerd en geannoteerd

300 Hrs

Nee
Talen

3 (100 uur x 3 talen)

Getranscribeerde en geannoteerde talen

Indiaas Engels, Hindi, Telugu

Project
Timeline

12 Weken

De uitdaging: het verzamelen van demografisch diverse spreektaal.

Het gebrek aan toegang tot gekwalificeerde taalkundigen, deskundige data-annotators en strakke deadlines vormen een knelpunt in de vooruitgang en de acceptatie van conversationele AI. Het vinden van taalkundigen, het transcriberen en annoteren van grote hoeveelheden datasets met de vereiste kwaliteit om AI-functionaliteiten te ontwikkelen, is een tijdrovende en kostbare taak die gekwalificeerde mensen uit diverse vakgebieden vereist.

De kritische eisen van de opdrachtgever waren:

  1. Toegang tot gekwalificeerde taalkundigen voor audio-opnames: Verzamel 300 uur aan audiomateriaal voor talen zoals Indiaas Engels, Hindi en Telugu, ingesproken door deskundige taalkundigen met een diverse demografische achtergrond.
  2. Complexe audiotranscriptie en -annotatie met een minimale nauwkeurigheid van 90%:
    • De volledige audiobestanden zijn getranscribeerd, waarbij alle gesproken woorden zijn vastgelegd – inclusief aarzelingen, stopwoordjes, valse starts en andere verbale ticjes.
    • Ondanks strenge transcriptierichtlijnen met betrekking tot dialectale uitspraak, verkeerd uitgesproken woorden, niet-standaard taalgebruik en interpunctie, leverde het transcript een foutloze output.
  3. Gegevenslevering: Levering van hoogwaardige en diverse audiobestanden, inclusief bijbehorende transcripties (JSON-formaat), in 3 talen binnen 12 weken.

De oplossing: domeinspecifieke audioverzameling, transcriptie en annotatie.

Met onze diepgaande kennis van conversationele AI hebben we de klant geholpen bij het verzamelen, transcriberen en annoteren van de data door een team van deskundige taalkundigen en annotatoren, om zo hun AI-gestuurde meertalige spraaksuite te trainen.

Na een evaluatie van diverse leveranciers koos de klant voor Shaip vanwege onze expertise in het voltooien van conversationele AI-projecten binnen strakke deadlines, kosteneffectief en met de vereiste kwaliteit. Het team was bovendien onder de indruk van Shaips robuuste en uitgebreide projectuitvoeringscapaciteiten.

Taal Aantal uren Ongepland algemeen gesprek (50%) Ongepland gesprek in een callcenter (30%) Online verwijderde mediacontent (20%)
Hindi 100 50 30 20
Engels 100 50 30 20
Telegu 100 50 30 20
Totaal 300 150 90 60
  1. Aanvullende vereisten voor audiocollectie
    • Frequentie: Bemonsteringsfrequentie – 16 kHz
    • Formaat: WAV
    • Duur – Algemene duur (5-30 min) – gesprekken
    • Spraakdomein – BFSI, telecommunicatie en detailhandel
    • Demografische diversiteit – Geslacht: 1:1 verhouding, Leeftijdscategorie: 18-60, Spreker-ID vastleggen om elke spreker uniek te identificeren.
  2. De richtlijnen voor audiosegmentatie, transcriptie en annotatie worden gevolgd.

    2.1 Segmentatie
    • Maak segmenten van 15 seconden (met tijdstempels tot op milliseconden nauwkeurig) voor afzonderlijke bestanden groter dan 30 seconden.
    • Segmentgeluidstypen – spraak, gebrabbel, muziek, lawaai, overlapping
    • Segmentlabeling – starttijd, eindtijd, segment-ID, luidheidsniveau, primair geluidstype,
      taalcode, spreker-ID


    2.2 Transcriptie en annotatie

    • De volledige audiobestanden zijn getranscribeerd, waarbij alle gesproken woorden zijn vastgelegd – inclusief aarzelingen, stopwoordjes, valse starts en andere verbale tics zoals symbolen en karakters.
    • Leverde foutloze output ondanks strenge transcriptierichtlijnen met betrekking tot dialectale uitspraak, verkeerd uitgesproken woorden, niet-standaard taalgebruik, interpunctie, hoofdlettergebruik, afkortingen, samentrekkingen, cijfers, acroniemen, onvloeiende en onverstaanbare spraak, en niet-doeltaal.
      talen, en meer.
  3. Levering van gegevens
    Alle WAV-audio- en transcriptbestanden werden binnen 12 weken in JSON-formaat aangeleverd, conform de unieke demografische gegevens van de sprekers.

Het resultaat: een productiegereed meertalig spraaksysteem.

De hoogwaardige, van aantekeningen voorziene audiogegevens van taalkundig experts stelden de klant in staat om hun AI-gestuurde spraakverwerkingssysteem voor meerdere talen, namelijk Indiaas Engels, Hindi en Telugu, nauwkeurig te trainen binnen de gestelde tijd.

Met de hoogwaardige trainingsdatasets kon de klant intelligente en robuuste spraak-naar-tekst-, taalvertalings- en meertalige toetsenborddiensten aanbieden om problemen uit de praktijk op te lossen.

Citaat icoon

We waren onder de indruk van Shaips robuuste projectuitvoeringscapaciteiten en hun expertise in het verkrijgen, transcriberen en annoteren van de benodigde audiogegevens van deskundige taalkundigen. De meerdere kwaliteitscontroles, het naleven van strakke deadlines en de kosteneffectiviteit die ze bieden, zijn ongeëvenaard.

★ ★ ★ ★ ★
Citaat icoon