| + | Afro-Amerikaanse volkstaal | 8 kHz | Callcenter | 211 |
| Korte omschrijving | African American Vernacular Call-center data | | Gegevenssetbeschrijving | Unscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes, | | Audio Channel | Dubbel | | Opnameplatform | Desktop | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Vrouw: 612, Man: 1242 en Onbekend: 12 |
|
| + | | 16 kHz | Podcast | 154 |
| Korte omschrijving | African American Vernacular Media data | | Gegevenssetbeschrijving | Licensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes | | Audio Channel | Mono | | Opnameplatform | Websourcing | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Vrouw: 151, Man: 150 en Onbekend: 10 |
|
| + | Afrikaans | 8 kHz | Algemeen gesprek | 368 |
| Korte omschrijving | Afrikaans General Conversation data | | Gegevenssetbeschrijving | Unscripted telephonic conversation between two people. Approx. Audio Duration (Range) - 15-60 minutes, Afrikaans spoken in Africa | | Audio Channel | Dubbel | | Opnameplatform | Desktop | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Vrouw: 502, Man: 390 en Onbekend: 2 |
|
| + | | 16 kHz | Podcast | 658 |
| Korte omschrijving | Afrikaans Media Files | | Gegevenssetbeschrijving | Licensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes | | Audio Channel | Mono | | Opnameplatform | Websourcing | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Vrouw: 750, Man: 1278 en Onbekend: 52 |
|
| + | Arabisch | 8 kHz | Algemeen gesprek | 292 |
| Korte omschrijving | Arabic General Conversation data | | Gegevenssetbeschrijving | Unscripted telephonic conversation between two people. Approx. Audio Duration (Range) - 15-60 minutes, Arabic from Gulf countries | | Audio Channel | Dubbel | | Opnameplatform | Desktop | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Vrouw: 171, Man: 534 en Onbekend: 1 |
|
| + | | 48 kHz | Monoloog met script | 1,947 |
| Korte omschrijving | Arabic Scripted Monologue | | Gegevenssetbeschrijving | Single-utterance recordings, which tend to fall in the 5 to 30 second range | | Audio Channel | Mono | | Opnameplatform | Mobile App | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Female 838 Male 1209 Unknown 78 |
|
| + | Assamese (In Pipeline) | | Callcenter | 60 |
| Korte omschrijving | Assamese (In Pipeline) Call-Center data | | Gegevenssetbeschrijving | Unscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes, | | Audio Channel | | | Opnameplatform | Desktop | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | |
|
| + | | | Algemeen gesprek | 100 |
| Korte omschrijving | Assamese (In Pipeline) General Conversation data | | Gegevenssetbeschrijving | Unscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes, | | Audio Channel | | | Opnameplatform | Desktop | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | |
|
| + | | | Podcast | 40 |
| Korte omschrijving | Assamese (In Pipeline) Media audio data | | Gegevenssetbeschrijving | Licensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes | | Audio Channel | | | Opnameplatform | Websourcing | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | |
|
| + | Bengali (In Pipeline) | | Callcenter | 60 |
| Korte omschrijving | Bengali (In Pipeline) Call-Center data | | Gegevenssetbeschrijving | Unscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes, | | Audio Channel | | | Opnameplatform | Desktop | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | |
|
| + | | | Algemeen gesprek | 100 |
| Korte omschrijving | Bengali (In Pipeline) General Conversation data | | Gegevenssetbeschrijving | Unscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes, | | Audio Channel | | | Opnameplatform | Desktop | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | |
|
| + | | | Podcast | 40 |
| Korte omschrijving | Bengali (In Pipeline) Media audio data | | Gegevenssetbeschrijving | Licensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes | | Audio Channel | | | Opnameplatform | Websourcing | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | |
|
| + | Boston Engels | 8 kHz | Callcenter | 177 |
| Korte omschrijving | Boston Call-center data | | Gegevenssetbeschrijving | Unscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes, | | Audio Channel | Dubbel | | Opnameplatform | Desktop | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Vrouw: 605, Man: 711 en Onbekend: 0 |
|
| + | | 8 kHz | Algemeen gesprek | 32 |
| Korte omschrijving | Boston General Conversation data | | Gegevenssetbeschrijving | Unscripted telephonic conversation between two people. Approx. Audio Duration (Range) - 15-60 minutes, | | Audio Channel | Dubbel | | Opnameplatform | Desktop | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Vrouw: 53, Man: 83 en Onbekend: 0 |
|
| + | | 16 kHz | Podcast | 93 |
| Korte omschrijving | Boston Media audio data | | Gegevenssetbeschrijving | Licensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes | | Audio Channel | Mono | | Opnameplatform | Websourcing | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Vrouw: 43, Man: 181 en Onbekend: 2 |
|
| + | Canadees Frans | 48 kHz | Monoloog met script | 1,222 |
| Korte omschrijving | Canadees Frans | | Gegevenssetbeschrijving | Single-utterance recordings, which tend to fall in the 5 to 30 second range | | Audio Channel | Mono | | Opnameplatform | Mobile App | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Female 974 Male 631 Unknown 1 |
|
| + | Chinees Engels | 8 kHz | Callcenter | 169 |
| Korte omschrijving | Chinese Call-center data | | Gegevenssetbeschrijving | Unscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes, | | Audio Channel | Dubbel | | Opnameplatform | Desktop | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Female: 1790, Male: 523 and Unknown: 13 |
|
| + | | 16 kHz | Podcast | 249 |
| Korte omschrijving | Chinese Media audio data | | Gegevenssetbeschrijving | Licensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes | | Audio Channel | Mono | | Opnameplatform | Websourcing | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Female: 126, Male: 346 and Unknown: 6 |
|
| + | Vereenvoudigd Chinees | 48 kHz | Monoloog met script | 2,762 |
| Korte omschrijving | Vereenvoudigd Chinees | | Gegevenssetbeschrijving | Single-utterance recordings, which tend to fall in the 5 to 30 second range | | Audio Channel | Mono | | Opnameplatform | Mobile App | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Female 1920 Male 1535 Unknown 270 |
|
| + | Traditioneel Chinees | 48 kHz | Monoloog met script | 1,028 |
| Korte omschrijving | Traditioneel Chinees | | Gegevenssetbeschrijving | Single-utterance recordings, which tend to fall in the 5 to 30 second range | | Audio Channel | Mono | | Opnameplatform | Mobile App | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Female 1069 Male 262 Unknown 3 |
|
| + | Deens | 8 kHz | Algemeen gesprek | 372 |
| Korte omschrijving | Danish General Conversation data | | Gegevenssetbeschrijving | Unscripted telephonic conversation between two people. Approx. Audio Duration (Range) - 15-60 minutes, | | Audio Channel | Dubbel | | Opnameplatform | Desktop | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Female: 311, Male: 417, Unknown: 0 |
|
| + | | 16 kHz | Podcast | 664 |
| Korte omschrijving | Danish Media audio data | | Gegevenssetbeschrijving | Licensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes | | Audio Channel | Mono | | Opnameplatform | Websourcing | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Female: 369, Male: 864, Unknown: 27 |
|
| + | | 48 kHz | Monoloog met script | 2,579 |
| Korte omschrijving | Danish Scripted Monologue | | Gegevenssetbeschrijving | Single-utterance recordings, which tend to fall in the 5 to 30 second range, Danish from Denmark | | Audio Channel | Mono | | Opnameplatform | Mobile App | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Female 1551 Male 1233 Unknown 42 |
|
| + | Engels Diep Zuid | 8 kHz | Callcenter | 151 |
| Korte omschrijving | English Deep South Call-center data | | Gegevenssetbeschrijving | Unscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes, | | Audio Channel | Dubbel | | Opnameplatform | Desktop | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Female 221 , Male 1004 , Unknown 7 |
|
| + | | 8 kHz | Algemeen gesprek | 56 |
| Korte omschrijving | English Deep South General Conversation data | | Gegevenssetbeschrijving | Unscripted telephonic conversation between two people. Approx. Audio Duration (Range) - 15-60 minutes, | | Audio Channel | Dubbel | | Opnameplatform | Desktop | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Female 99, Male 31, Unknown 0 |
|
| + | | 16 kHz | Podcast | 266 |
| Korte omschrijving | English Deep South Media audio data | | Gegevenssetbeschrijving | Licensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes | | Audio Channel | Mono | | Opnameplatform | Websourcing | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Female 204, Male 356, Unknown 21 |
|
| + | Duits | 8 kHz | Callcenter | 64 |
| Korte omschrijving | German Call-center data | | Gegevenssetbeschrijving | Unscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes, | | Audio Channel | Mono | | Opnameplatform | Desktop | | WER (%) | | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Female 478 Male 1440 Unknown 0 |
|
| + | | 8 kHz | IVR | 200 |
| Korte omschrijving | German IVR data | | Gegevenssetbeschrijving | Human to Machine. An IVR type of flow where there is a TTS prompt (e.g. ”How may I help you”) followed by a spontaneous human response | | Audio Channel | Mono | | Opnameplatform | Desktop | | WER (%) | | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Female 10115 Male 8750 Unknown 0 |
|
| + | Gujarati (In Pipeline) | | Callcenter | 60 |
| Korte omschrijving | Gujarati (In Pipeline) Call-Center data | | Gegevenssetbeschrijving | Unscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes, | | Audio Channel | | | Opnameplatform | Desktop | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | |
|
| + | | | Algemeen gesprek | 100 |
| Korte omschrijving | Gujarati (In Pipeline) General Conversation data | | Gegevenssetbeschrijving | Unscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes, | | Audio Channel | | | Opnameplatform | Desktop | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | |
|
| + | | | Podcast | 40 |
| Korte omschrijving | Gujarati (In Pipeline) Media audio data | | Gegevenssetbeschrijving | Licensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes | | Audio Channel | | | Opnameplatform | Websourcing | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | |
|
| + | Hebreeuws | 8 kHz | Algemeen gesprek | 399 |
| Korte omschrijving | Hebrew General Conversation data | | Gegevenssetbeschrijving | Unscripted telephonic conversation between two people. Approx. Audio Duration (Range) - 15-60 minutes, Hebrew in Israel | | Audio Channel | Dubbel | | Opnameplatform | Desktop | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Female 414 , Male 399 , Unknown 1 |
|
| + | | 16 kHz | Podcast | 427 |
| Korte omschrijving | Hebrew Media audio data | | Gegevenssetbeschrijving | Licensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes | | Audio Channel | Mono | | Opnameplatform | Websourcing | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Female 361 , Male 513, Unknown 13 |
|
| + | Hindi | 16 kHz | Podcast | 219 |
| Korte omschrijving | Hindi Media audio data | | Gegevenssetbeschrijving | Licensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes | | Audio Channel | Mono | | Opnameplatform | Websourcing | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Female 83 , Male 309, Unknown 0 |
|
| + | | 48 kHz | Monoloog met script | 2,867 |
| Korte omschrijving | Hindi Scripted Monologue | | Gegevenssetbeschrijving | Single-utterance recordings, which tend to fall in the 5 to 30 second range | | Audio Channel | Mono | | Opnameplatform | Mobile App | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Female 1977 Male 1864 Unknown 147 |
|
| + | Hinglish | 8 kHz | Callcenter | 208 |
| Korte omschrijving | HINGLISH Call-center data | | Gegevenssetbeschrijving | Unscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes, | | Audio Channel | Dubbel | | Opnameplatform | Desktop | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Female 822, Male 1262 , Unknown 0 |
|
| + | | 16 kHz | Podcast | 216 |
| Korte omschrijving | HINGLISH Media audio data | | Gegevenssetbeschrijving | Licensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes | | Audio Channel | Mono | | Opnameplatform | Websourcing | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Female 75, Male 380, Unknown 0 |
|
| + | Spaans Engels | 8 kHz | Callcenter | 212 |
| Korte omschrijving | Hispanic Call-center data | | Gegevenssetbeschrijving | Unscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes, | | Audio Channel | Dubbel | | Opnameplatform | Desktop | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Vrouw 822, Man 1262, Onbekend 0 |
|
| + | | 16 kHz | Podcast | 155 |
| Korte omschrijving | Hispanic Call Media audio | | Gegevenssetbeschrijving | Licensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes | | Audio Channel | Mono | | Opnameplatform | Websourcing | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Vrouw 140, Man 219, Onbekend 5 |
|
| + | Indonesian | 8 kHz | Algemeen gesprek | 496 |
| Korte omschrijving | Indonesian General Conversation data | | Gegevenssetbeschrijving | Unscripted telephonic conversation between two people. Approx. Audio Duration (Range) - 15-60 minutes, Bahasa Indonesian | | Audio Channel | Dubbel | | Opnameplatform | Desktop | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Vrouw 524, Man 454, Onbekend 2 |
|
| + | | 16 kHz | Podcast | 643 |
| Korte omschrijving | Indonesian Media audio data | | Gegevenssetbeschrijving | Licensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes | | Audio Channel | Mono | | Opnameplatform | Websourcing | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Vrouw 746, Man 1507, Onbekend 129 |
|
| + | Iers | 8 kHz | Algemeen gesprek | 192 |
| Korte omschrijving | Irish General Conversation data | | Gegevenssetbeschrijving | Unscripted telephonic conversation between two people. Approx. Audio Duration (Range) - 15-60 minutes, | | Audio Channel | Dubbel | | Opnameplatform | Desktop | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Female 213 , Male 153 , Unknown 0 |
|
| + | Japans | 48 kHz | Monoloog met script | 2,335 |
| Korte omschrijving | Japanese Scripted Monologue | | Gegevenssetbeschrijving | Single-utterance recordings, which tend to fall in the 5 to 30 second range | | Audio Channel | Mono | | Opnameplatform | Mobile App | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Female 1460 Male 1221 Unknown 194 |
|
| + | Kannada (In Pipeline) | | Callcenter | 60 |
| Korte omschrijving | Kannada (In Pipeline) Call-Center data | | Gegevenssetbeschrijving | Unscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes, | | Audio Channel | | | Opnameplatform | Desktop | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | |
|
| + | | | Algemeen gesprek | 100 |
| Korte omschrijving | Kannada (In Pipeline) General Conversation data | | Gegevenssetbeschrijving | Unscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes, | | Audio Channel | | | Opnameplatform | Desktop | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | |
|
| + | | | Podcast | 40 |
| Korte omschrijving | Kannada (In Pipeline) Media audio data | | Gegevenssetbeschrijving | Licensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes | | Audio Channel | | | Opnameplatform | Websourcing | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | |
|
| + | Korean | 8 kHz | Callcenter | 107 |
| Korte omschrijving | Korean Call-center data | | Gegevenssetbeschrijving | Unscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes, | | Audio Channel | Dubbel | | Opnameplatform | Desktop | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Vrouw 1086, Man 210 , Onbekend 4 |
|
| + | | 16 kHz | Podcast | 204 |
| Korte omschrijving | Korean media audio data | | Gegevenssetbeschrijving | Licensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes | | Audio Channel | Mono | | Opnameplatform | Websourcing | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Female 70 Male 303, Unknown 25 |
|
| + | | 48 kHz | Monoloog met script | 1,955 |
| Korte omschrijving | Korean Scripted Monologue | | Gegevenssetbeschrijving | Single-utterance recordings, which tend to fall in the 5 to 30 second range | | Audio Channel | Mono | | Opnameplatform | Mobile App | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Female 1195 Male 1134 Unknown 122 |
|
| + | Malay | 8 kHz | Algemeen gesprek | 266 |
| Korte omschrijving | Malay General Conversation data | | Gegevenssetbeschrijving | Unscripted telephonic conversation between two people. Approx. Audio Duration (Range) - 15-60 minutes, Malay in Malaysia | | Audio Channel | Dubbel | | Opnameplatform | Desktop | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Female 316, Male 176 , Unknown 0 |
|
| + | | 16 kHz | Podcast | 344 |
| Korte omschrijving | Malay Media audio data | | Gegevenssetbeschrijving | Licensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes | | Audio Channel | Mono | | Opnameplatform | Websourcing | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Female 236, Male 626, Unknown 47 |
|
| + | Malayalam (In Pipeline) | | Callcenter | 60 |
| Korte omschrijving | Malayalam (In Pipeline) Call-Center data | | Gegevenssetbeschrijving | Unscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes, | | Audio Channel | | | Opnameplatform | Desktop | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | |
|
| + | | | Algemeen gesprek | 100 |
| Korte omschrijving | Malayalam (In Pipeline) General Conversation data | | Gegevenssetbeschrijving | Unscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes, | | Audio Channel | | | Opnameplatform | Desktop | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | |
|
| + | | | Podcast | 40 |
| Korte omschrijving | Malayalam (In Pipeline) Media audio data | | Gegevenssetbeschrijving | Licensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes | | Audio Channel | | | Opnameplatform | Websourcing | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | |
|
| + | Marathi (In Pipeline) | | Callcenter | 60 |
| Korte omschrijving | Marathi (In Pipeline) Call-Center data | | Gegevenssetbeschrijving | Unscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes, | | Audio Channel | | | Opnameplatform | Desktop | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | |
|
| + | | | Algemeen gesprek | 100 |
| Korte omschrijving | Marathi (In Pipeline) General Conversation data | | Gegevenssetbeschrijving | Unscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes, | | Audio Channel | | | Opnameplatform | Desktop | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | |
|
| + | | | Podcast | 40 |
| Korte omschrijving | Marathi (In Pipeline) Media audio data | | Gegevenssetbeschrijving | Licensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes | | Audio Channel | | | Opnameplatform | Websourcing | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | |
|
| + | Spaans (Mexico) | 48 kHz | Monoloog met script | 1,492 |
| Korte omschrijving | Mexican Spanish Scripted Monologue | | Gegevenssetbeschrijving | Single-utterance recordings, which tend to fall in the 5 to 30 second range | | Audio Channel | Mono | | Opnameplatform | Mobile App | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Female 1016 Male 1069 Unknown 95 |
|
| + | Nederlands | 48 kHz | Monoloog met script | 1,205 |
| Korte omschrijving | Dutch Scripted Monologue | | Gegevenssetbeschrijving | Single-utterance recordings, which tend to fall in the 5 to 30 second range | | Audio Channel | Mono | | Opnameplatform | Mobile App | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Female 1285 Male 531 Unknown 3 |
|
| + | New York Engels | 8 kHz | Callcenter | 103 |
| Korte omschrijving | New York English Call-center data | | Gegevenssetbeschrijving | Unscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes, | | Audio Channel | Dubbel | | Opnameplatform | Desktop | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Female 610, Male 532, Unknow 0 |
|
| + | | 8 kHz | Algemeen gesprek | 107 |
| Korte omschrijving | New York English General Conversation data | | Gegevenssetbeschrijving | Unscripted telephonic conversation between two people. Approx. Audio Duration (Range) - 15-60 minutes, | | Audio Channel | Dubbel | | Opnameplatform | Desktop | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Vrouw 118, Man 114, Onbekend 0 |
|
| + | | 16 kHz | Podcast | 140 |
| Korte omschrijving | New York English Media audio data | | Gegevenssetbeschrijving | Licensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes | | Audio Channel | Mono | | Opnameplatform | Websourcing | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Vrouw 66, Man 230, Onbekend 11 |
|
| + | Nieuw-Zeeland Engels | 8 kHz | Algemeen gesprek | 148 |
| Korte omschrijving | New Zealand English General Conversation data | | Gegevenssetbeschrijving | Unscripted telephonic conversation between two people. Approx. Audio Duration (Range) - 15-60 minutes, | | Audio Channel | Dubbel | | Opnameplatform | Desktop | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Vrouw 167, man 121, Onbekend 4 |
|
| + | | 16 kHz | Podcast | 400 |
| Korte omschrijving | New Zealand English Media audio | | Gegevenssetbeschrijving | Licensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes | | Audio Channel | Mono | | Opnameplatform | Websourcing | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Vrouw 367, man 678, Onbekend 26 |
|
| + | Oriya (In Pipeline) | | Callcenter | 60 |
| Korte omschrijving | Oriya (In Pipeline) Call-Center data | | Gegevenssetbeschrijving | Unscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes, | | Audio Channel | | | Opnameplatform | Desktop | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | |
|
| + | | | Algemeen gesprek | 100 |
| Korte omschrijving | Oriya (In Pipeline) General Conversation data | | Gegevenssetbeschrijving | Unscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes, | | Audio Channel | | | Opnameplatform | Desktop | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | |
|
| + | | | Podcast | 40 |
| Korte omschrijving | Oriya (In Pipeline) Media audio data | | Gegevenssetbeschrijving | Licensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes | | Audio Channel | | | Opnameplatform | Websourcing | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | |
|
| + | Pools | 16 kHz | Podcast | 269 |
| Korte omschrijving | Polish Media audio | | Gegevenssetbeschrijving | Licensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes | | Audio Channel | Mono | | Opnameplatform | Websourcing | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Vrouw 173 Man 354 Onbekend 6 |
|
| + | Pools (Polen) | 48 kHz | Monoloog met script | 1,482 |
| Korte omschrijving | Polish Poland - Scripted Monologue | | Gegevenssetbeschrijving | Single-utterance recordings, which tend to fall in the 5 to 30 second range | | Audio Channel | Mono | | Opnameplatform | Mobile App | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Female 1324 Male 701 Unknown 24 |
|
| + | Punjabi (In Pipeline) | | Callcenter | 60 |
| Korte omschrijving | Punjabi (In Pipeline) Call-Center data | | Gegevenssetbeschrijving | Unscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes, | | Audio Channel | | | Opnameplatform | Desktop | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | |
|
| + | | | Algemeen gesprek | 100 |
| Korte omschrijving | Punjabi (In Pipeline) General Conversation data | | Gegevenssetbeschrijving | Unscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes, | | Audio Channel | | | Opnameplatform | Desktop | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | |
|
| + | | | Podcast | 40 |
| Korte omschrijving | Punjabi (In Pipeline) Media audio data | | Gegevenssetbeschrijving | Licensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes | | Audio Channel | | | Opnameplatform | Websourcing | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | |
|
| + | Russian | 48 kHz | Monoloog met script | 2,398 |
| Korte omschrijving | Russian Scripted Monologue | | Gegevenssetbeschrijving | Single-utterance recordings, which tend to fall in the 5 to 30 second range | | Audio Channel | Mono | | Opnameplatform | Mobile App | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Female 1689 Male 1937 Unknown 214 |
|
| + | Schots (Engels accent) | 8 kHz | Algemeen gesprek | 292 |
| Korte omschrijving | Scottish General Conversation data | | Gegevenssetbeschrijving | Unscripted telephonic conversation between two people. Approx. Audio Duration (Range) - 15-60 minutes, | | Audio Channel | Dubbel | | Opnameplatform | Desktop | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Female 285 , Male 260, Unknown 3 |
|
| + | Singapore Engels | 8 kHz | Callcenter | 218 |
| Korte omschrijving | Singapore Call-Center data | | Gegevenssetbeschrijving | Unscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes, | | Audio Channel | Dubbel | | Opnameplatform | Desktop | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Vrouw 2139 , Man 884, Onbekend 21 |
|
| + | | 16 kHz | Podcast | 247 |
| Korte omschrijving | Singapore Media audio data | | Gegevenssetbeschrijving | Licensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes | | Audio Channel | Mono | | Opnameplatform | Websourcing | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Vrouw 160, Man 455, Onbekend 37 |
|
| + | Zuid-Afrikaans Engels | 8 kHz | Callcenter | 261 |
| Korte omschrijving | South African English Call-Center data | | Gegevenssetbeschrijving | Unscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes, | | Audio Channel | Dubbel | | Opnameplatform | Desktop | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Female 1274 , Male 935 , Unknown 1 |
|
| + | | 16 kHz | Podcast | 251 |
| Korte omschrijving | South African English Media audio data | | Gegevenssetbeschrijving | Licensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes | | Audio Channel | Mono | | Opnameplatform | Websourcing | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Vrouw 235, Man 432, Onbekend 36 |
|
| + | swahili | 8 kHz | Callcenter | 230 |
| Korte omschrijving | Swahili Call-Center data | | Gegevenssetbeschrijving | Unscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes, | | Audio Channel | Dubbel | | Opnameplatform | Desktop | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Vrouw 611, Man 833, Onbekend 0 |
|
| + | | 16 kHz | Podcast | 265 |
| Korte omschrijving | Swahili Media audio data | | Gegevenssetbeschrijving | Licensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes | | Audio Channel | Mono | | Opnameplatform | Websourcing | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Vrouw 118, Man 493, Onbekend 25 |
|
| + | Zweeds | 8 kHz | Callcenter | 250 |
| Korte omschrijving | Swedish Call-Center data | | Gegevenssetbeschrijving | Unscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes, | | Audio Channel | Dubbel | | Opnameplatform | Desktop | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Female 1581, male 727, Unknown 2 |
|
| + | | 16 kHz | Podcast | 278 |
| Korte omschrijving | Swedish Media audio data | | Gegevenssetbeschrijving | Licensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes | | Audio Channel | Mono | | Opnameplatform | Websourcing | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Female 195, male 500, Unknown 21 |
|
| + | Tamil (In Pipeline) | | Callcenter | 60 |
| Korte omschrijving | Tamil (In Pipeline) Call-Center data | | Gegevenssetbeschrijving | Unscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes, | | Audio Channel | | | Opnameplatform | Desktop | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | |
|
| + | | | Algemeen gesprek | 100 |
| Korte omschrijving | Tamil (In Pipeline) General Conversation data | | Gegevenssetbeschrijving | Unscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes, | | Audio Channel | | | Opnameplatform | Desktop | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | |
|
| + | | | Podcast | 40 |
| Korte omschrijving | Tamil (In Pipeline) Media audio data | | Gegevenssetbeschrijving | Licensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes | | Audio Channel | | | Opnameplatform | Websourcing | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | |
|
| + | Telugu | 8 kHz | Algemeen gesprek | 553 |
| Korte omschrijving | Telugu General Conversation data | | Gegevenssetbeschrijving | Unscripted telephonic conversation between two people. Approx. Audio Duration (Range) - 15-60 minutes, | | Audio Channel | Dubbel | | Opnameplatform | Desktop | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Vrouw 574 , Man 564, Onbekend 0 |
|
| + | | 16 kHz | Podcast | 648 |
| Korte omschrijving | Telugu Media audio data | | Gegevenssetbeschrijving | Licensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes | | Audio Channel | Mono | | Opnameplatform | Websourcing | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Vrouw 207, Man 963, Onbekend 2 |
|
| + | Telugu (In Pipeline) | | Callcenter | 30 |
| Korte omschrijving | Telugu (In Pipeline) Call-Center data | | Gegevenssetbeschrijving | Unscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes, | | Audio Channel | | | Opnameplatform | Desktop | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | |
|
| + | | | Algemeen gesprek | 50 |
| Korte omschrijving | Telugu (In Pipeline) General Conversation data | | Gegevenssetbeschrijving | Unscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes, | | Audio Channel | | | Opnameplatform | Desktop | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | |
|
| + | | | Podcast | 20 |
| Korte omschrijving | Telugu (In Pipeline) Media audio data | | Gegevenssetbeschrijving | Licensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes | | Audio Channel | | | Opnameplatform | Websourcing | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | |
|
| + | Thai | 8 kHz | Algemeen gesprek | 183 |
| Korte omschrijving | Thai General Conversation | | Gegevenssetbeschrijving | Unscripted telephonic conversation between two people. Approx. Audio Duration (Range) - 15-60 minutes, An informal register used between friends | | Audio Channel | Dubbel | | Opnameplatform | Desktop | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Vrouw 338, Man 96, Onbekend 8 |
|
| + | | 16 kHz | Podcast | 173 |
| Korte omschrijving | Thai Media audio | | Gegevenssetbeschrijving | Licensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes | | Audio Channel | Mono | | Opnameplatform | Websourcing | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Vrouw 143, Man 502, Onbekend 26 |
|
| + | Turks Turkije | 48 kHz | Monoloog met script | 2,027 |
| Korte omschrijving | Turks Turkije | | Gegevenssetbeschrijving | Single-utterance recordings, which tend to fall in the 5 to 30 second range | | Audio Channel | Mono | | Opnameplatform | Mobile App | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Female 1561 Male 1241 Unknown 31 |
|
| + | Vietnamees | 8 kHz | Algemeen gesprek | 295 |
| Korte omschrijving | Vietnamese General Conversation data | | Gegevenssetbeschrijving | Unscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes, Northern (e.g.,Hanoi), Central, and Southern (e.g., Ho Chi Minh City). | | Audio Channel | Dubbel | | Opnameplatform | Desktop | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Vrouw 400, man 380, Onbekenden 2 |
|
| + | | 16 kHz | Podcast | 257 |
| Korte omschrijving | Vietnamese Media audio data | | Gegevenssetbeschrijving | Licensable Public domain audio/video files such as interviews, podcasts etc - 1 to 5 people. Approx. Audio Duration (Range) 15-60 minutes | | Audio Channel | Mono | | Opnameplatform | Websourcing | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Vrouw 249, man 200, Onbekenden 45 |
|
| + | Wels (Engels accent) | 8 kHz | Algemeen gesprek | 278 |
| Korte omschrijving | Welsh General Conversation data | | Gegevenssetbeschrijving | Unscripted, synthetic telephonic conversation between "agent" and "customer", Approx. Audio Duration (Range) 5-15 Minutes, | | Audio Channel | Dubbel | | Opnameplatform | Desktop | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Vrouw 270, Man 324, Onbekend 0 |
|
| + | UK Engels | 16 kHz | Word Wekken | 200-Sprekers |
| Korte omschrijving | Wake Word UK English | | Gegevenssetbeschrijving | keyphrases collection of data
- 200 speakers
- 4 unieke sleutelzinnen per spreker
- 25-30 herhaalde keyphrases opnames per unieke keyphrase
- 25-30 audiobestanden per unieke sleutelzin
- 120 totaal opgenomen uitingen per spreker
| | Audio Channel | 1 kanaal | | Opnameplatform | Mobile App | | WER (%) | 5.0 | | Audioformaat | . Wav | | Transcriptie-indeling | .json | | Use Case | ASR, Virtual Assistant, Chatbot, Conversational AI, Speech Analytics, TTS, Language Modeling | | Aantal Luidsprekers | Gender: 50% male, 50% female, +/- 10%. |
|