Hoe Shaip een schaalbaar programma voor kwaliteitsbeoordeling van stemklonen heeft geleverd voor een AI-spraakklant

Van demo-kwaliteit tot implementatieklaar: hoe gestructureerde menselijke evaluatie een AI-spraakclient hielp de kloof tussen laboratoriumresultaten en prestaties in de praktijk te overbruggen.

Stem klonen

project Overzicht

Stemkloningsmodellen klinken misschien indrukwekkend in demo's, maar presteren in de praktijk vaak minder goed. De klant had een betrouwbare manier nodig om te meten of hun model daadwerkelijk verbeterde – met name voor Indiaas Engels, een prioritaire markt voor de implementatie.

Shaip werd ingeschakeld om een ​​programma voor personeelsevaluatie te ontwerpen en te beheren dat antwoord kon geven op drie belangrijke zakelijke vragen:

  • Klinkt de spraak natuurlijk?
  • Klinkt het nog steeds hetzelfde als met de originele luidspreker?
  • Is het veilig en betrouwbaar genoeg voor productiegebruik?

In plaats van uitsluitend op geautomatiseerde meetmethoden te vertrouwen, maakte het project gebruik van getrainde menselijke beoordelaars om echte audio-uitvoer te evalueren en vast te stellen waar het model nog tekortschoot.

Kwaliteit van stemklonen

Belangrijkste datasetstatistieken

Use Case

Kwaliteitsbeoordeling van stemklonen

Projectduur

12 Weken

Beoordeelde monsters

12,400 gesynthetiseerde audioclips

Annotatoren ingezet

48 opgeleide Engelse beoordelaars

Uitdagingen bij het beoordelen van de kwaliteit van TTS en stemklonen.

  • Het model moest goed functioneren in verschillende contexten. meerdere Engelse accentenmet name Indiaas Engels.
  • De audiokwaliteit moest verbeteren op manieren die er voor eindgebruikers toe doen, niet alleen op basis van laboratoriummetingen.
  • Het team had een duidelijke manier nodig om te identificeren Wat ging er mis met de spraakuitvoer?.
  • Bij lange audiofragmenten kon na verloop van tijd de identiteit van de oorspronkelijke spreker soms verloren gaan.
  • De klant had ook cheques nodig voor veiligheid, risico op identiteitsfraude en aanwezigheid van watermerken.

Oplossing: Kader voor menselijke evaluatie van de spraakkwaliteit van AI

Evaluatiestrategie

Shaip ontwikkelde een gestructureerd beoordelingskader om de natuurlijkheid, duidelijkheid, stemovereenkomst, consistentie en veiligheid te evalueren.

Menselijke beoordeling op grote schaal

48 getrainde beoordelaars hebben 12,400 audiofragmenten beoordeeld, verdeeld over Indiaas Engels, neutraal Amerikaans Engels en een Hinglish-subcategorie.

Driedelige beoordeling

  • Recensenten beoordeelden hoe natuurlijk en verstaanbaar elk fragment klonk.
  • Ze vergeleken paren van videoclips om te bepalen welke versie beter was.
  • Ze hebben terugkerende kwaliteitsproblemen zoals een onnatuurlijk ritme, toonhoogteproblemen en luidsprekerverschuivingen aangemerkt.

Kwaliteitscontrole

Shaip gebruikte kalibratietaken, gouden standaardcontroles, herhaalde beoordelingen en kwaliteitscontrole om de score consistent en betrouwbaar te houden.

Bruikbare feedbacklus

De bevindingen van elke sprint werden teruggekoppeld naar het afstemmingsproces van de klant, waardoor het model in de loop van meerdere rondes kon verbeteren.

Projectomvang: Talen, accenten en beoordelingsdekking

De Omgeving strekking
Taal Engels
Prioriteitsaccenten Indiaas Engels, Neutraal Amerikaans Engels
Secundaire dekking Brits Engels, sub-track Hinglish
Voorbeeldtypen Korte referentieclips, fragmenten met weinig opnames, langere toespraken
Controleer de uitvoer Kwaliteitsbeoordelingen, voorkeurslabels, probleemtagging
Verlovingslengte 12 weken

Resultaten: Meetbare verbeteringen in stemklonen

  • Duidelijke verbetering van de spraakkwaliteit: De algehele kwaliteitsscore van het model verbeterde van 3.41 naar 4.12, wat aantoont dat de spraak natuurlijker en productieklaarder werd.
  • Betere luidsprekerafstemming: Het systeem is er aanzienlijk beter in geslaagd de stem van de oorspronkelijke spreker te behouden, waardoor de gelijkenis is verbeterd van 0.71 naar 0.87.
  • Minder opvallende fouten: Het percentage spraakproblemen daalde van 31% bij aanvang van het onderzoek tot 11% aan het eind van de studie.
  • Sterke verstaanbaarheid: Het uiteindelijke woordfoutpercentage voor Indiaas Engels bereikte 4.8%, waarmee de streefwaarde werd overtroffen.
  • Betere paraatheid voor inzet: De evaluatie bevestigde ook de goede prestaties op belangrijke veiligheidscontroles, waaronder screening op identiteitsfraude en verificatie van watermerken.
Het allerbelangrijkste was dat de klant een herhaalbaar evaluatiesysteem kreeg dat niet alleen gebruikt kon worden om de modelkwaliteit te beoordelen, maar ook om deze continu te verbeteren. Wat begon als een technisch beoordelingsprogramma, werd een praktisch hulpmiddel voor besluitvorming voor productteams, modelteams en belanghebbenden bij de implementatie.
Citaat icoon

Shaip heeft ons geholpen om subjectieve audiokwaliteit om te zetten in een meetbaar verbeteringsprogramma. Hun evaluatiekader gaf ons duidelijke aanwijzingen over wat we moesten aanpassen, waar we konden verbeteren en hoe we met vertrouwen dichter bij de productie konden komen.

— Productleider AI-spraak

★ ★ ★ ★ ★
Citaat icoon