Meest vertrouwde spraakgegevensverzamelingsservices voor uw AI

Train uw NLP-modellen, VA's, TTS-prototypes en meer met hoogwaardige gespreksgegevens, met onze diensten voor het verzamelen van audio- en spraakgegevens

Spraakgegevens verzamelen
Landen
0 +
Uren van
Spraak gegevens
0 +
Maak kennis met
0 +
Talen (100+ dialecten)
0 +

8 / 16 / 44 / 48 kHz

sampling rate

Professionele diensten voor het verzamelen van audio-/spraakgegevens

Elk onderwerp. Elk scenario.

Bij Shaip ligt onze expertise in het creëren van spraakdatasets van hoge kwaliteit die zijn ontworpen voor uiteenlopende AI/ML-vereisten. We bieden een uitgebreid scala aan talen en registreren in diverse omgevingen, waardoor onze datasets uitgebreid en aanpasbaar zijn. Onze focus ligt op het voeden van modellen met het hoogste volume aan aangepaste spraakdata, in de kortst mogelijke tijd. Met ons aan boord kunt u het volgende verwachten: 

Spraakverzameling
  • Gecureerde, hoogwaardige meertalige audio-/spraakgegevens om de nauwkeurigheid te verbeteren
  • Hoogst mogelijke mate van domeinspecificiteit om diverse scenario-instellingen te targeten
  • Schaal uw ML-model om het aan te passen aan verschillende demografische gegevens en branches
  • Opnameomgevingen: Studiokwaliteit, met kristalheldere audio met minimaal achtergrondgeluid, en Natuurlijke omgevingen, waarbij opnames omgevingsgeluiden bevatten om situaties uit de echte wereld na te bootsen.

Onze expertise

Stem audiogegevens af op slimmere NLP-modellen

Shaip biedt end-to-end spraak-/audiogegevensverzamelingsservices in meer dan 100+ talen om spraakgestuurde technologieën mogelijk te maken voor een diverse groep doelgroepen over de hele wereld. We kunnen werken aan projecten van elke omvang en omvang; van het licentiëren van bestaande standaard audiodatasets tot het beheren van aangepaste audiodataverzameling tot audiotranscriptie en annotatie. Hoe groot uw project voor het verzamelen van spraakgegevens ook is, we kunnen de audioverzamelingsservices aanpassen aan uw behoeften om hoogwaardige NLP-gegevenssets te bouwen die gericht zijn op dialecten, tonen en talen. Kies uit ons brede aanbod aan spraakdatasets en bronnen voor het verzamelen van audiodata, voor intelligente opstellingen die spraak mogelijk maken.

Monoloog toespraak

Monoloog, scripted en spontane toespraak

Het richt zich op het verwerken van spraak van een enkele spreker. Gebruik gescripte aanwijzingen om audiobestanden met één kanaal in te voeren, zodat unieke spraakpatronen, tonen en nuances worden vastgelegd die specifiek zijn voor die persoon.

Dialoog toespraak

Dialoogscript en spontane spraak

Interactie tussen twee personen, waarbij gesprekken en dialogen uit de echte wereld worden gerepliceerd met meertalige blootstelling via tweekanaalsbestanden en getranscribeerde bronnen.

Gesprekken met meerdere partijen

Groep / Muti-partij
Gesprekken

Discussies met meerdere personen, waarbij groepsdynamiek, overlappingen en gevarieerde tonen worden vastgelegd om spraakmodellen nauwkeurig te trainen.

Verzameling van wake-word-uitingen

Verzameling wake-word/sleutelzin/uitspraken

Train AI's om sleutelzinnen te identificeren of woorden of uitingen met vergelijkbare betekenissen wakker te maken met behulp van diverse, rijke en authentieke uitingen voor geavanceerde verwerking en begrip van natuurlijke taal.

Akoestische spraak

Akoestische gegevens
Collectie

We kunnen op professionele wijze audiogegevens van studiokwaliteit opnemen, of het nu restaurants, kantoren of huizen zijn of vanuit verschillende omgevingen en talen, terwijl we een breder akoestisch bereik bestrijken (Comprehensive Sound Datasets).

Automatische spraakherkenning

Automatische spraakherkenning (ASR)

Verbeter de nauwkeurigheid van uw automatische spraakherkenningssystemen (ASR) door toegang te hebben tot geavanceerde, gediversifieerde spraak-/audiodatasets uit een breed scala aan demografische gegevens.

Natuurlijke taaluiting

Meertalige spraak-/audiotrainingsgegevens

Onze ervaren taalprofessionals over de hele wereld bieden meertalige audio-/spraakgegevens in verschillende talen en dialecten. Deze inspanning bevordert de mondiale communicatie en overbrugt taalbarrières, waardoor wordt bijgedragen aan meer inclusieve en effectieve AI-oplossingen.

Digitale virtuele assistenten

Text-to-Speech
(TTS)

Bouw een meertalig tekst-naar-spraakmodel (TTS) met de hulp van ons wereldwijde personeelsbestand, dat u helpt spraakgegevens te verzamelen in meer dan 150 talen en dialecten om uw AI-modellen te verbeteren, van bedieningselementen in de auto tot chatbots en leeroplossingen met hoogwaardige hoogwaardige audiogegevens.

Opnames van callcenters

Call Center
Gesprekken

Echte uitwisselingen tussen agenten en klanten, waarbij talloze talen worden ondersteund, zoals Spaans, Duits, Amerikaans Engels, Bengaals, Japans, Chinees en Hindi.

Succesverhalen

Conversationele AI-datasets met meer dan 3 uur aan gegevens in 8 talen

De klant wilde een meertalig platform voor Indiase talen bouwen en werkte samen met Shaip om grote datasets in meerdere Indiase talen te verzamelen, segmenteren en transcriberen. Dit zou helpen bij het ontwikkelen van effectieve spraakmodellen die het innovatieve nieuwe platform van de cliënt zouden kunnen aandrijven.

Probleem: Meer dan 3,000 uur aan audiogegevens verzameld in 8 Indiase talen, gesegmenteerd en getranscribeerd om automatische spraakherkenning te ontwikkelen.

Oplossing: Wij verzorgden de dataverzameling, segmentatie, transcriptie en leverden JSON-bestanden met metadata. We verzamelden op grote schaal 3000 uur aan audiogegevens in 8 Indiase talen voor het spraaktechnologieproject van de klant.

Casestudy voor het verzamelen van spraakgegevens

Redenen om Shaip te kiezen als uw betrouwbare partner voor het verzamelen van spraakgegevens

Mensen

Mensen

Toegewijde en getrainde teams:

  • 30,000+ medewerkers voor gegevenscreatie, labeling en QA
  • Gecertificeerd projectmanagementteam
  • Ervaren productontwikkelingsteam
  • Talentpool Sourcing & Onboarding-team
Proces

Proces

De hoogste procesefficiëntie wordt gegarandeerd met:

  • Robuust 6 Sigma Stage-Gate-proces
  • Een toegewijd team van 6 Sigma black belts – Key process owners & Quality compliance
  • Continue verbetering en feedbacklus
Platform

Platform

Het gepatenteerde platform biedt voordelen:

  • Webgebaseerd end-to-end platform
  • Onberispelijke kwaliteit
  • Snellere TAT
  • Naadloze levering

Kant-en-klare spraak-/audiodatasets

TaalgegevenssetSample RateGegevenssettypeTotaal aantal audio-uren
+Afro-Amerikaanse volkstaal8 kHzCallcenter211
Korte omschrijvingAfrican American Vernacular Call-center data
GegevenssetbeschrijvingUnscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes,
Audio ChannelDubbel
OpnameplatformDesktop
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersVrouw: 612, Man: 1242 en Onbekend: 12
+16 kHzPodcast154
Korte omschrijvingAfrican American Vernacular Media data
GegevenssetbeschrijvingLicensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes
Audio ChannelMono
OpnameplatformWebsourcing
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersVrouw: 151, Man: 150 en Onbekend: 10
+Afrikaans8 kHzAlgemeen gesprek368
Korte omschrijvingAfrikaans General Conversation data
GegevenssetbeschrijvingUnscripted telephonic conversation between two people. Approx. Audio Duration (Range) - 15-60 minutes, Afrikaans spoken in Africa
Audio ChannelDubbel
OpnameplatformDesktop
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersVrouw: 502, Man: 390 en Onbekend: 2
+16 kHzPodcast658
Korte omschrijvingAfrikaans Media Files
GegevenssetbeschrijvingLicensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes
Audio ChannelMono
OpnameplatformWebsourcing
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersVrouw: 750, Man: 1278 en Onbekend: 52
+Arabisch8 kHzAlgemeen gesprek292
Korte omschrijvingArabic General Conversation data
GegevenssetbeschrijvingUnscripted telephonic conversation between two people. Approx. Audio Duration (Range) - 15-60 minutes, Arabic from Gulf countries
Audio ChannelDubbel
OpnameplatformDesktop
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersVrouw: 171, Man: 534 en Onbekend: 1
+48 kHzMonoloog met script1,947
Korte omschrijvingArabic Scripted Monologue
GegevenssetbeschrijvingSingle-utterance recordings, which tend to fall in the 5 to 30 second range
Audio ChannelMono
OpnameplatformMobile App
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersFemale 838 Male 1209 Unknown 78
+Assamese (In Pipeline) Callcenter60
Korte omschrijvingAssamese (In Pipeline) Call-Center data
GegevenssetbeschrijvingUnscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes,
Audio Channel
OpnameplatformDesktop
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal Luidsprekers
+Algemeen gesprek100
Korte omschrijvingAssamese (In Pipeline) General Conversation data
GegevenssetbeschrijvingUnscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes,
Audio Channel
OpnameplatformDesktop
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal Luidsprekers
+Podcast40
Korte omschrijvingAssamese (In Pipeline) Media audio data
GegevenssetbeschrijvingLicensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes
Audio Channel
OpnameplatformWebsourcing
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal Luidsprekers
+Bengali (In Pipeline) Callcenter60
Korte omschrijvingBengali (In Pipeline) Call-Center data
GegevenssetbeschrijvingUnscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes,
Audio Channel
OpnameplatformDesktop
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal Luidsprekers
+Algemeen gesprek100
Korte omschrijvingBengali (In Pipeline) General Conversation data
GegevenssetbeschrijvingUnscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes,
Audio Channel
OpnameplatformDesktop
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal Luidsprekers
+Podcast40
Korte omschrijvingBengali (In Pipeline) Media audio data
GegevenssetbeschrijvingLicensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes
Audio Channel
OpnameplatformWebsourcing
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal Luidsprekers
+Boston Engels8 kHzCallcenter177
Korte omschrijvingBoston Call-center data
GegevenssetbeschrijvingUnscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes,
Audio ChannelDubbel
OpnameplatformDesktop
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersVrouw: 605, Man: 711 en Onbekend: 0
+8 kHzAlgemeen gesprek32
Korte omschrijvingBoston General Conversation data
GegevenssetbeschrijvingUnscripted telephonic conversation between two people. Approx. Audio Duration (Range) - 15-60 minutes,
Audio ChannelDubbel
OpnameplatformDesktop
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersVrouw: 53, Man: 83 en Onbekend: 0
+16 kHzPodcast93
Korte omschrijvingBoston Media audio data
GegevenssetbeschrijvingLicensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes
Audio ChannelMono
OpnameplatformWebsourcing
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersVrouw: 43, Man: 181 en Onbekend: 2
+Canadees Frans48 kHzMonoloog met script1,222
Korte omschrijvingCanadees Frans
GegevenssetbeschrijvingSingle-utterance recordings, which tend to fall in the 5 to 30 second range
Audio ChannelMono
OpnameplatformMobile App
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersFemale 974 Male 631 Unknown 1
+Chinees Engels8 kHzCallcenter169
Korte omschrijvingChinese Call-center data
GegevenssetbeschrijvingUnscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes,
Audio ChannelDubbel
OpnameplatformDesktop
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersFemale: 1790, Male: 523 and Unknown: 13
+16 kHzPodcast249
Korte omschrijvingChinese Media audio data
GegevenssetbeschrijvingLicensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes
Audio ChannelMono
OpnameplatformWebsourcing
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersFemale: 126, Male: 346 and Unknown: 6
+Vereenvoudigd Chinees48 kHzMonoloog met script2,762
Korte omschrijvingVereenvoudigd Chinees
GegevenssetbeschrijvingSingle-utterance recordings, which tend to fall in the 5 to 30 second range
Audio ChannelMono
OpnameplatformMobile App
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersFemale 1920 Male 1535 Unknown 270
+Traditioneel Chinees48 kHzMonoloog met script1,028
Korte omschrijvingTraditioneel Chinees
GegevenssetbeschrijvingSingle-utterance recordings, which tend to fall in the 5 to 30 second range
Audio ChannelMono
OpnameplatformMobile App
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersFemale 1069 Male 262 Unknown 3
+Deens8 kHzAlgemeen gesprek372
Korte omschrijvingDanish General Conversation data
GegevenssetbeschrijvingUnscripted telephonic conversation between two people. Approx. Audio Duration (Range) - 15-60 minutes,
Audio ChannelDubbel
OpnameplatformDesktop
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersFemale: 311, Male: 417, Unknown: 0
+16 kHzPodcast664
Korte omschrijvingDanish Media audio data
GegevenssetbeschrijvingLicensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes
Audio ChannelMono
OpnameplatformWebsourcing
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersFemale: 369, Male: 864, Unknown: 27
+48 kHzMonoloog met script2,579
Korte omschrijvingDanish Scripted Monologue
GegevenssetbeschrijvingSingle-utterance recordings, which tend to fall in the 5 to 30 second range, Danish from Denmark
Audio ChannelMono
OpnameplatformMobile App
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersFemale 1551 Male 1233 Unknown 42
+Engels Diep Zuid8 kHzCallcenter151
Korte omschrijvingEnglish Deep South Call-center data
GegevenssetbeschrijvingUnscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes,
Audio ChannelDubbel
OpnameplatformDesktop
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersFemale 221 , Male 1004 , Unknown 7
+8 kHzAlgemeen gesprek56
Korte omschrijvingEnglish Deep South General Conversation data
GegevenssetbeschrijvingUnscripted telephonic conversation between two people. Approx. Audio Duration (Range) - 15-60 minutes,
Audio ChannelDubbel
OpnameplatformDesktop
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersFemale 99, Male 31, Unknown 0
+16 kHzPodcast266
Korte omschrijvingEnglish Deep South Media audio data
GegevenssetbeschrijvingLicensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes
Audio ChannelMono
OpnameplatformWebsourcing
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersFemale 204, Male 356, Unknown 21
+Duits8 kHzCallcenter64
Korte omschrijvingGerman Call-center data
GegevenssetbeschrijvingUnscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes,
Audio ChannelMono
OpnameplatformDesktop
WER (%)
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersFemale 478 Male 1440 Unknown 0
+8 kHz IVR200
Korte omschrijvingGerman IVR data
GegevenssetbeschrijvingHuman to Machine. An IVR type of flow where there is a TTS prompt (e.g. ”How may I help you”) followed by a spontaneous human response
Audio ChannelMono
OpnameplatformDesktop
WER (%)
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersFemale 10115 Male 8750 Unknown 0
+Gujarati (In Pipeline) Callcenter60
Korte omschrijvingGujarati (In Pipeline) Call-Center data
GegevenssetbeschrijvingUnscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes,
Audio Channel
OpnameplatformDesktop
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal Luidsprekers
+Algemeen gesprek100
Korte omschrijvingGujarati (In Pipeline) General Conversation data
GegevenssetbeschrijvingUnscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes,
Audio Channel
OpnameplatformDesktop
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal Luidsprekers
+Podcast40
Korte omschrijvingGujarati (In Pipeline) Media audio data
GegevenssetbeschrijvingLicensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes
Audio Channel
OpnameplatformWebsourcing
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal Luidsprekers
+Hebreeuws8 kHzAlgemeen gesprek399
Korte omschrijvingHebrew General Conversation data
GegevenssetbeschrijvingUnscripted telephonic conversation between two people. Approx. Audio Duration (Range) - 15-60 minutes, Hebrew in Israel
Audio ChannelDubbel
OpnameplatformDesktop
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersFemale 414 , Male 399 , Unknown 1
+16 kHzPodcast427
Korte omschrijvingHebrew Media audio data
GegevenssetbeschrijvingLicensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes
Audio ChannelMono
OpnameplatformWebsourcing
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersFemale 361 , Male 513, Unknown 13
+Hindi16 kHzPodcast219
Korte omschrijvingHindi Media audio data
GegevenssetbeschrijvingLicensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes
Audio ChannelMono
OpnameplatformWebsourcing
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersFemale 83 , Male 309, Unknown 0
+48 kHzMonoloog met script2,867
Korte omschrijvingHindi Scripted Monologue
GegevenssetbeschrijvingSingle-utterance recordings, which tend to fall in the 5 to 30 second range
Audio ChannelMono
OpnameplatformMobile App
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersFemale 1977 Male 1864 Unknown 147
+Hinglish8 kHzCallcenter208
Korte omschrijvingHINGLISH Call-center data
GegevenssetbeschrijvingUnscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes,
Audio ChannelDubbel
OpnameplatformDesktop
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersFemale 822, Male 1262 , Unknown 0
+16 kHzPodcast216
Korte omschrijvingHINGLISH Media audio data
GegevenssetbeschrijvingLicensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes
Audio ChannelMono
OpnameplatformWebsourcing
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersFemale 75, Male 380, Unknown 0
+Spaans Engels8 kHzCallcenter212
Korte omschrijvingHispanic Call-center data
GegevenssetbeschrijvingUnscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes,
Audio ChannelDubbel
OpnameplatformDesktop
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersVrouw 822, Man 1262, Onbekend 0
+16 kHzPodcast155
Korte omschrijvingHispanic Call Media audio
GegevenssetbeschrijvingLicensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes
Audio ChannelMono
OpnameplatformWebsourcing
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersVrouw 140, Man 219, Onbekend 5
+Indonesian8 kHzAlgemeen gesprek496
Korte omschrijvingIndonesian General Conversation data
GegevenssetbeschrijvingUnscripted telephonic conversation between two people. Approx. Audio Duration (Range) - 15-60 minutes, Bahasa Indonesian
Audio ChannelDubbel
OpnameplatformDesktop
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersVrouw 524, Man 454, Onbekend 2
+16 kHzPodcast643
Korte omschrijvingIndonesian Media audio data
GegevenssetbeschrijvingLicensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes
Audio ChannelMono
OpnameplatformWebsourcing
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersVrouw 746, Man 1507, Onbekend 129
+Iers8 kHzAlgemeen gesprek192
Korte omschrijvingIrish General Conversation data
GegevenssetbeschrijvingUnscripted telephonic conversation between two people. Approx. Audio Duration (Range) - 15-60 minutes,
Audio ChannelDubbel
OpnameplatformDesktop
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersFemale 213 , Male 153 , Unknown 0
+Japans48 kHzMonoloog met script2,335
Korte omschrijvingJapanese Scripted Monologue
GegevenssetbeschrijvingSingle-utterance recordings, which tend to fall in the 5 to 30 second range
Audio ChannelMono
OpnameplatformMobile App
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersFemale 1460 Male 1221 Unknown 194
+Kannada (In Pipeline) Callcenter60
Korte omschrijvingKannada (In Pipeline) Call-Center data
GegevenssetbeschrijvingUnscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes,
Audio Channel
OpnameplatformDesktop
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal Luidsprekers
+Algemeen gesprek100
Korte omschrijvingKannada (In Pipeline) General Conversation data
GegevenssetbeschrijvingUnscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes,
Audio Channel
OpnameplatformDesktop
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal Luidsprekers
+Podcast40
Korte omschrijvingKannada (In Pipeline) Media audio data
GegevenssetbeschrijvingLicensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes
Audio Channel
OpnameplatformWebsourcing
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal Luidsprekers
+Korean8 kHzCallcenter107
Korte omschrijvingKorean Call-center data
GegevenssetbeschrijvingUnscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes,
Audio ChannelDubbel
OpnameplatformDesktop
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersVrouw 1086, Man 210 , Onbekend 4
+16 kHzPodcast204
Korte omschrijvingKorean media audio data
GegevenssetbeschrijvingLicensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes
Audio ChannelMono
OpnameplatformWebsourcing
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersFemale 70 Male 303, Unknown 25
+48 kHzMonoloog met script1,955
Korte omschrijvingKorean Scripted Monologue
GegevenssetbeschrijvingSingle-utterance recordings, which tend to fall in the 5 to 30 second range
Audio ChannelMono
OpnameplatformMobile App
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersFemale 1195 Male 1134 Unknown 122
+Malay8 kHzAlgemeen gesprek266
Korte omschrijvingMalay General Conversation data
GegevenssetbeschrijvingUnscripted telephonic conversation between two people. Approx. Audio Duration (Range) - 15-60 minutes, Malay in Malaysia
Audio ChannelDubbel
OpnameplatformDesktop
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersFemale 316, Male 176 , Unknown 0
+16 kHzPodcast344
Korte omschrijvingMalay Media audio data
GegevenssetbeschrijvingLicensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes
Audio ChannelMono
OpnameplatformWebsourcing
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersFemale 236, Male 626, Unknown 47
+Malayalam (In Pipeline) Callcenter60
Korte omschrijvingMalayalam (In Pipeline) Call-Center data
GegevenssetbeschrijvingUnscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes,
Audio Channel
OpnameplatformDesktop
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal Luidsprekers
+Algemeen gesprek100
Korte omschrijvingMalayalam (In Pipeline) General Conversation data
GegevenssetbeschrijvingUnscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes,
Audio Channel
OpnameplatformDesktop
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal Luidsprekers
+Podcast40
Korte omschrijvingMalayalam (In Pipeline) Media audio data
GegevenssetbeschrijvingLicensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes
Audio Channel
OpnameplatformWebsourcing
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal Luidsprekers
+Marathi (In Pipeline) Callcenter60
Korte omschrijvingMarathi (In Pipeline) Call-Center data
GegevenssetbeschrijvingUnscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes,
Audio Channel
OpnameplatformDesktop
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal Luidsprekers
+Algemeen gesprek100
Korte omschrijvingMarathi (In Pipeline) General Conversation data
GegevenssetbeschrijvingUnscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes,
Audio Channel
OpnameplatformDesktop
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal Luidsprekers
+Podcast40
Korte omschrijvingMarathi (In Pipeline) Media audio data
GegevenssetbeschrijvingLicensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes
Audio Channel
OpnameplatformWebsourcing
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal Luidsprekers
+Spaans (Mexico)48 kHzMonoloog met script1,492
Korte omschrijvingMexican Spanish Scripted Monologue
GegevenssetbeschrijvingSingle-utterance recordings, which tend to fall in the 5 to 30 second range
Audio ChannelMono
OpnameplatformMobile App
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersFemale 1016 Male 1069 Unknown 95
+Nederlands48 kHzMonoloog met script1,205
Korte omschrijvingDutch Scripted Monologue
GegevenssetbeschrijvingSingle-utterance recordings, which tend to fall in the 5 to 30 second range
Audio ChannelMono
OpnameplatformMobile App
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersFemale 1285 Male 531 Unknown 3
+New York Engels8 kHzCallcenter103
Korte omschrijvingNew York English Call-center data
GegevenssetbeschrijvingUnscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes,
Audio ChannelDubbel
OpnameplatformDesktop
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersFemale 610, Male 532, Unknow 0
+8 kHzAlgemeen gesprek107
Korte omschrijvingNew York English General Conversation data
GegevenssetbeschrijvingUnscripted telephonic conversation between two people. Approx. Audio Duration (Range) - 15-60 minutes,
Audio ChannelDubbel
OpnameplatformDesktop
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersVrouw 118, Man 114, Onbekend 0
+16 kHzPodcast140
Korte omschrijvingNew York English Media audio data
GegevenssetbeschrijvingLicensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes
Audio ChannelMono
OpnameplatformWebsourcing
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersVrouw 66, Man 230, Onbekend 11
+Nieuw-Zeeland Engels 8 kHzAlgemeen gesprek148
Korte omschrijvingNew Zealand English General Conversation data
GegevenssetbeschrijvingUnscripted telephonic conversation between two people. Approx. Audio Duration (Range) - 15-60 minutes,
Audio ChannelDubbel
OpnameplatformDesktop
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersVrouw 167, man 121, Onbekend 4
+16 kHzPodcast400
Korte omschrijvingNew Zealand English Media audio
GegevenssetbeschrijvingLicensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes
Audio ChannelMono
OpnameplatformWebsourcing
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersVrouw 367, man 678, Onbekend 26
+Oriya (In Pipeline) Callcenter60
Korte omschrijvingOriya (In Pipeline) Call-Center data
GegevenssetbeschrijvingUnscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes,
Audio Channel
OpnameplatformDesktop
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal Luidsprekers
+Algemeen gesprek100
Korte omschrijvingOriya (In Pipeline) General Conversation data
GegevenssetbeschrijvingUnscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes,
Audio Channel
OpnameplatformDesktop
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal Luidsprekers
+Podcast40
Korte omschrijvingOriya (In Pipeline) Media audio data
GegevenssetbeschrijvingLicensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes
Audio Channel
OpnameplatformWebsourcing
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal Luidsprekers
+Pools16 kHzPodcast269
Korte omschrijvingPolish Media audio
GegevenssetbeschrijvingLicensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes
Audio ChannelMono
OpnameplatformWebsourcing
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersVrouw 173 Man 354 Onbekend 6
+Pools (Polen)48 kHzMonoloog met script1,482
Korte omschrijvingPolish Poland - Scripted Monologue
GegevenssetbeschrijvingSingle-utterance recordings, which tend to fall in the 5 to 30 second range
Audio ChannelMono
OpnameplatformMobile App
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersFemale 1324 Male 701 Unknown 24
+Punjabi (In Pipeline) Callcenter60
Korte omschrijvingPunjabi (In Pipeline) Call-Center data
GegevenssetbeschrijvingUnscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes,
Audio Channel
OpnameplatformDesktop
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal Luidsprekers
+Algemeen gesprek100
Korte omschrijvingPunjabi (In Pipeline) General Conversation data
GegevenssetbeschrijvingUnscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes,
Audio Channel
OpnameplatformDesktop
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal Luidsprekers
+Podcast40
Korte omschrijvingPunjabi (In Pipeline) Media audio data
GegevenssetbeschrijvingLicensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes
Audio Channel
OpnameplatformWebsourcing
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal Luidsprekers
+Russian48 kHzMonoloog met script2,398
Korte omschrijvingRussian Scripted Monologue
GegevenssetbeschrijvingSingle-utterance recordings, which tend to fall in the 5 to 30 second range
Audio ChannelMono
OpnameplatformMobile App
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersFemale 1689 Male 1937 Unknown 214
+Schots (Engels accent)8 kHzAlgemeen gesprek292
Korte omschrijvingScottish General Conversation data
GegevenssetbeschrijvingUnscripted telephonic conversation between two people. Approx. Audio Duration (Range) - 15-60 minutes,
Audio ChannelDubbel
OpnameplatformDesktop
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersFemale 285 , Male 260, Unknown 3
+Singapore Engels8 kHzCallcenter218
Korte omschrijvingSingapore Call-Center data
GegevenssetbeschrijvingUnscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes,
Audio ChannelDubbel
OpnameplatformDesktop
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersVrouw 2139 , Man 884, Onbekend 21
+16 kHzPodcast247
Korte omschrijvingSingapore Media audio data
GegevenssetbeschrijvingLicensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes
Audio ChannelMono
OpnameplatformWebsourcing
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersVrouw 160, Man 455, Onbekend 37
+Zuid-Afrikaans Engels8 kHzCallcenter261
Korte omschrijvingSouth African English Call-Center data
GegevenssetbeschrijvingUnscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes,
Audio ChannelDubbel
OpnameplatformDesktop
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersFemale 1274 , Male 935 , Unknown 1
+16 kHzPodcast251
Korte omschrijvingSouth African English Media audio data
GegevenssetbeschrijvingLicensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes
Audio ChannelMono
OpnameplatformWebsourcing
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersVrouw 235, Man 432, Onbekend 36
+swahili8 kHzCallcenter230
Korte omschrijvingSwahili Call-Center data
GegevenssetbeschrijvingUnscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes,
Audio ChannelDubbel
OpnameplatformDesktop
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersVrouw 611, Man 833, Onbekend 0
+16 kHzPodcast265
Korte omschrijvingSwahili Media audio data
GegevenssetbeschrijvingLicensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes
Audio ChannelMono
OpnameplatformWebsourcing
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersVrouw 118, Man 493, Onbekend 25
+Zweeds8 kHzCallcenter250
Korte omschrijvingSwedish Call-Center data
GegevenssetbeschrijvingUnscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes,
Audio ChannelDubbel
OpnameplatformDesktop
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersFemale 1581, male 727, Unknown 2
+16 kHzPodcast278
Korte omschrijvingSwedish Media audio data
GegevenssetbeschrijvingLicensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes
Audio ChannelMono
OpnameplatformWebsourcing
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersFemale 195, male 500, Unknown 21
+Tamil (In Pipeline) Callcenter60
Korte omschrijvingTamil (In Pipeline) Call-Center data
GegevenssetbeschrijvingUnscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes,
Audio Channel
OpnameplatformDesktop
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal Luidsprekers
+Algemeen gesprek100
Korte omschrijvingTamil (In Pipeline) General Conversation data
GegevenssetbeschrijvingUnscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes,
Audio Channel
OpnameplatformDesktop
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal Luidsprekers
+Podcast40
Korte omschrijvingTamil (In Pipeline) Media audio data
GegevenssetbeschrijvingLicensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes
Audio Channel
OpnameplatformWebsourcing
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal Luidsprekers
+Telugu8 kHzAlgemeen gesprek553
Korte omschrijvingTelugu General Conversation data
GegevenssetbeschrijvingUnscripted telephonic conversation between two people. Approx. Audio Duration (Range) - 15-60 minutes,
Audio ChannelDubbel
OpnameplatformDesktop
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersVrouw 574 , Man 564, Onbekend 0
+16 kHzPodcast648
Korte omschrijvingTelugu Media audio data
GegevenssetbeschrijvingLicensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes
Audio ChannelMono
OpnameplatformWebsourcing
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersVrouw 207, Man 963, Onbekend 2
+Telugu (In Pipeline) Callcenter30
Korte omschrijvingTelugu (In Pipeline) Call-Center data
GegevenssetbeschrijvingUnscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes,
Audio Channel
OpnameplatformDesktop
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal Luidsprekers
+Algemeen gesprek50
Korte omschrijvingTelugu (In Pipeline) General Conversation data
GegevenssetbeschrijvingUnscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes,
Audio Channel
OpnameplatformDesktop
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal Luidsprekers
+Podcast20
Korte omschrijvingTelugu (In Pipeline) Media audio data
GegevenssetbeschrijvingLicensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes
Audio Channel
OpnameplatformWebsourcing
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal Luidsprekers
+Thai8 kHzAlgemeen gesprek183
Korte omschrijvingThai General Conversation
GegevenssetbeschrijvingUnscripted telephonic conversation between two people. Approx. Audio Duration (Range) - 15-60 minutes, An informal register used between friends
Audio ChannelDubbel
OpnameplatformDesktop
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersVrouw 338, Man 96, Onbekend 8
+16 kHzPodcast173
Korte omschrijvingThai Media audio
GegevenssetbeschrijvingLicensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes
Audio ChannelMono
OpnameplatformWebsourcing
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersVrouw 143, Man 502, Onbekend 26
+Turks Turkije48 kHzMonoloog met script2,027
Korte omschrijvingTurks Turkije
GegevenssetbeschrijvingSingle-utterance recordings, which tend to fall in the 5 to 30 second range
Audio ChannelMono
OpnameplatformMobile App
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersFemale 1561 Male 1241 Unknown 31
+Vietnamees8 kHzAlgemeen gesprek295
Korte omschrijvingVietnamese General Conversation data
GegevenssetbeschrijvingUnscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes, Northern (e.g.,Hanoi), Central, and Southern (e.g., Ho Chi Minh City).
Audio ChannelDubbel
OpnameplatformDesktop
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersVrouw 400, man 380, Onbekenden 2
+16 kHzPodcast257
Korte omschrijvingVietnamese Media audio data
GegevenssetbeschrijvingLicensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes
Audio ChannelMono
OpnameplatformWebsourcing
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersVrouw 249, man 200, Onbekenden 45
+Wels (Engels accent)8 kHzAlgemeen gesprek278
Korte omschrijvingWelsh General Conversation data
GegevenssetbeschrijvingUnscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes,
Audio ChannelDubbel
OpnameplatformDesktop
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersVrouw 270, Man 324, Onbekend 0
+UK Engels16 kHzWord Wekken200-Sprekers
Korte omschrijvingWake Word UK English
Gegevenssetbeschrijvingkeyphrases collection of data
  • 200 speakers
  • 4 unieke sleutelzinnen per spreker
  • 25-30 herhaalde keyphrases opnames per unieke keyphrase
  • 25-30 audiobestanden per unieke sleutelzin
  • 120 totaal opgenomen uitingen per spreker
Audio Channel1 kanaal
OpnameplatformMobile App
WER (%)5.0
Audioformaat. Wav
Transcriptie-indeling.json
Use CaseASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling
Aantal LuidsprekersGender: 50% male, 50% female, +/- 10%.

Diensten aangeboden

Het verzamelen van tekstgegevens door experts is niet alle-hands-on-deck voor uitgebreide AI-setups. Bij Shaip kun je zelfs de volgende services overwegen om modellen veel wijder dan normaal te maken:

Verzameling van tekstgegevens

Diensten voor het verzamelen van tekstgegevens

De echte waarde van Shaip-diensten voor cognitieve gegevensverzameling is dat het organisaties de sleutel geeft om kritieke informatie in ongestructureerde gegevens te ontsluiten

Verzameling van beeldgegevens

Diensten voor het verzamelen van beeldgegevens

Zorg ervoor dat uw computer vision-model elk beeld nauwkeurig identificeert, om de volgende generatie AI-modellen van de toekomst naadloos te trainen

Verzameling van videogegevens

Diensten voor het verzamelen van videogegevens

Concentreer u nu op computervisie samen met NLP voor het trainen van uw modellen om objecten, individuen, afschrikmiddelen en andere visuele elementen tot in de perfectie te identificeren

Uitgelichte klanten

Teams in staat stellen om toonaangevende AI-producten te bouwen.

Neem contact met ons op

Wilt u uw eigen audiodataset bouwen?

Neem contact op met onze interne expert voor het verzamelen van spraakgegevens om een ​​audiorepository op te zetten die het beste bij uw vereisten past

  • Dit veld is voor de validatie doeleinden en moet onveranderd worden gelaten.
  • Door te registreren ga ik akkoord met Shaip Privacybeleid en Algemene Voorwaarden en geef mijn toestemming om B2B-marketingcommunicatie van Shaip te ontvangen.

Het verzamelen van spraakgegevens voor een ML-model verwijst naar het proces van het verzamelen van audio-opnamen van gesproken taal. Deze verzameling helpt bij het trainen en verfijnen van machine learning-algoritmen, met name die gericht op het begrijpen en verwerken van menselijke stemmen.

Wanneer u audiogegevens wilt verzamelen voor automatische spraakherkenning (ASR), moet u beginnen met het definiëren van de specifieke behoeften van uw project, inclusief de gewenste taal, accent en type spraak. Zorg ervoor dat u na het instellen van deze parameters alle benodigde machtigingen verkrijgt om de privacy van gebruikers te respecteren. Gebruik vervolgens geschikte opnameapparaten of software om duidelijke audiofragmenten vast te leggen. Elke opname moet zorgvuldig worden geannoteerd met de transcriptie of andere relevante metagegevens en systematisch worden opgeslagen voor moeiteloze toegang.

Een spraakdataset in machinaal leren is cruciaal voor het trainen, testen en valideren van modellen die zijn afgestemd op het herkennen, transcriberen of interpreteren van gesproken taal. Dergelijke datasets maken de weg vrij voor een groot aantal toepassingen, van stemassistenten en transcriptiediensten tot stembiometrie.

Voor het verzamelen van nauwkeurige gegevens over verschillende talen en accenten is samenwerking met moedertaalsprekers met de gewenste taalachtergrond essentieel. Streef naar een gevarieerde en representatieve steekproef die een breed spectrum van demografische nuances bestrijkt. Gebruik gestandaardiseerde opnameapparatuur in uniforme omgevingen om audioconsistentie te garanderen. En nog belangrijker: annoteer elk gegevensstuk met gedetailleerde transcripties en metagegevens, die de specifieke taal en het specifieke accent aangeven.