Hoe Shaip een schaalbaar programma voor kwaliteitsbeoordeling van stemklonen heeft geleverd voor een AI-spraakklant
Van demo-kwaliteit tot implementatieklaar: hoe gestructureerde menselijke evaluatie een AI-spraakclient hielp de kloof tussen laboratoriumresultaten en prestaties in de praktijk te overbruggen.
project Overzicht
Stemkloningsmodellen klinken misschien indrukwekkend in demo's, maar presteren in de praktijk vaak minder goed. De klant had een betrouwbare manier nodig om te meten of hun model daadwerkelijk verbeterde – met name voor Indiaas Engels, een prioritaire markt voor de implementatie.
Shaip werd ingeschakeld om een programma voor personeelsevaluatie te ontwerpen en te beheren dat antwoord kon geven op drie belangrijke zakelijke vragen:
- Klinkt de spraak natuurlijk?
- Klinkt het nog steeds hetzelfde als met de originele luidspreker?
- Is het veilig en betrouwbaar genoeg voor productiegebruik?
In plaats van uitsluitend op geautomatiseerde meetmethoden te vertrouwen, maakte het project gebruik van getrainde menselijke beoordelaars om echte audio-uitvoer te evalueren en vast te stellen waar het model nog tekortschoot.
Belangrijkste datasetstatistieken
Use Case
Kwaliteitsbeoordeling van stemklonen
Projectduur
12 Weken
Beoordeelde monsters
12,400 gesynthetiseerde audioclips
Annotatoren ingezet
48 opgeleide Engelse beoordelaars
Uitdagingen bij het beoordelen van de kwaliteit van TTS en stemklonen.
- Het model moest goed functioneren in verschillende contexten. meerdere Engelse accentenmet name Indiaas Engels.
- De audiokwaliteit moest verbeteren op manieren die er voor eindgebruikers toe doen, niet alleen op basis van laboratoriummetingen.
- Het team had een duidelijke manier nodig om te identificeren Wat ging er mis met de spraakuitvoer?.
- Bij lange audiofragmenten kon na verloop van tijd de identiteit van de oorspronkelijke spreker soms verloren gaan.
- De klant had ook cheques nodig voor veiligheid, risico op identiteitsfraude en aanwezigheid van watermerken.
Oplossing: Kader voor menselijke evaluatie van de spraakkwaliteit van AI
Evaluatiestrategie
Shaip ontwikkelde een gestructureerd beoordelingskader om de natuurlijkheid, duidelijkheid, stemovereenkomst, consistentie en veiligheid te evalueren.
Menselijke beoordeling op grote schaal
48 getrainde beoordelaars hebben 12,400 audiofragmenten beoordeeld, verdeeld over Indiaas Engels, neutraal Amerikaans Engels en een Hinglish-subcategorie.
Driedelige beoordeling
- Recensenten beoordeelden hoe natuurlijk en verstaanbaar elk fragment klonk.
- Ze vergeleken paren van videoclips om te bepalen welke versie beter was.
- Ze hebben terugkerende kwaliteitsproblemen zoals een onnatuurlijk ritme, toonhoogteproblemen en luidsprekerverschuivingen aangemerkt.
Kwaliteitscontrole
Shaip gebruikte kalibratietaken, gouden standaardcontroles, herhaalde beoordelingen en kwaliteitscontrole om de score consistent en betrouwbaar te houden.
Bruikbare feedbacklus
De bevindingen van elke sprint werden teruggekoppeld naar het afstemmingsproces van de klant, waardoor het model in de loop van meerdere rondes kon verbeteren.
Projectomvang: Talen, accenten en beoordelingsdekking
| De Omgeving | strekking |
|---|---|
| Taal | Engels |
| Prioriteitsaccenten | Indiaas Engels, Neutraal Amerikaans Engels |
| Secundaire dekking | Brits Engels, sub-track Hinglish |
| Voorbeeldtypen | Korte referentieclips, fragmenten met weinig opnames, langere toespraken |
| Controleer de uitvoer | Kwaliteitsbeoordelingen, voorkeurslabels, probleemtagging |
| Verlovingslengte | 12 weken |
Resultaten: Meetbare verbeteringen in stemklonen
- Duidelijke verbetering van de spraakkwaliteit: De algehele kwaliteitsscore van het model verbeterde van 3.41 naar 4.12, wat aantoont dat de spraak natuurlijker en productieklaarder werd.
- Betere luidsprekerafstemming: Het systeem is er aanzienlijk beter in geslaagd de stem van de oorspronkelijke spreker te behouden, waardoor de gelijkenis is verbeterd van 0.71 naar 0.87.
- Minder opvallende fouten: Het percentage spraakproblemen daalde van 31% bij aanvang van het onderzoek tot 11% aan het eind van de studie.
- Sterke verstaanbaarheid: Het uiteindelijke woordfoutpercentage voor Indiaas Engels bereikte 4.8%, waarmee de streefwaarde werd overtroffen.
- Betere paraatheid voor inzet: De evaluatie bevestigde ook de goede prestaties op belangrijke veiligheidscontroles, waaronder screening op identiteitsfraude en verificatie van watermerken.
Shaip heeft ons geholpen om subjectieve audiokwaliteit om te zetten in een meetbaar verbeteringsprogramma. Hun evaluatiekader gaf ons duidelijke aanwijzingen over wat we moesten aanpassen, waar we konden verbeteren en hoe we met vertrouwen dichter bij de productie konden komen.
— Productleider AI-spraak