Spraakdataset

Arabische dataset

البيانات-programma's

Hoogwaardige Arabische algemene conversatie en tekst-naar-spraak (TTS) voor AI en spraakmodellen

Arabische dataset

Overzicht

  • TaalArabisch
  • DatasettypenCallcenter, algemene conversatie, gescripte monoloog, zangaudio
  • LandArabisch

Beschrijving

Deze dataset bevat niet-gescripte synthetische telefoongesprekken tussen agenten en klanten (5-15 minuten), natuurlijke telefoongesprekken tussen mensen in het Golf-Arabisch (15-60 minuten) en gezongen audio met transcripties. Daarmee worden uiteenlopende spraakgegevens verkregen voor het trainen en evalueren van spraak- en taaltechnologieën.

Hoogtepunten van de dataset

  • TaalArabisch
  • Sample Rate24 kHz / 48 kHz / 8 kHz
  • Uren in totaal7894:35:33
  • Sprekers2,761+
  • KanalenDubbel / Mono
  • Duurbereik5 - 60 minuten

Gebruikers verhalen

  • ASR (automatische spraakherkenning)
  • Virtuele assistenten en chatbots
  • Conversationele AI
  • Spraakanalyse
  • TTS (tekst-naar-spraak)
  • Taalmodellering

Specificaties van de voorbeeldgegevensset

GegevenssettypeCall CenterCall CenterAlgemeen gesprekMusicMonoloog met scriptMonoloog met script
Sampling Rate8 kHz8 kHz8 kHz48 kHz48 kHz24 kHz
Sprekers2-Sprekers2-Sprekers2-SprekersEnkele luidsprekerEnkele luidsprekerEnkele luidspreker
KanaalDubbelMonoDubbelMonoMonoMono
Uren in totaal62:52:191,025:09:19254:16:3403:17:214,249:00:002,300:00:00
Totaal aantal sprekersOp aanvraagOp aanvraag626102,125Op aanvraag

Belangrijkste voordelen

  • Divers en representatiefEen breed scala aan sprekers over inclusieve, praktijkgerichte AI.
  • Hoogwaardige audioZuivere, evenwichtige opnames voor betrouwbare modelprestaties.
  • Klaar voor AI/MLGestructureerd en van aantekeningen voorzien voor naadloze integratie.
  • Schaalbaar en flexibelDiverse duur, sprekers en thema's beschikbaar, afgestemd op uw behoeften.

Uitgelichte klanten

Vertrouwd door toonaangevende AI-teams en bedrijven wereldwijd.

  • Microsoft
  • Amazon Web Services
  • Google

Kunt u niet vinden wat u zoekt?

Er worden nieuwe kant-en-klare datasets verzameld voor alle datatypen

Neem nu contact met ons op om uw zorgen over het verzamelen van audio-/spraaktrainingsgegevens los te laten

  • Dit veld is voor de validatie doeleinden en moet onveranderd worden gelaten.
  • Door te registreren ga ik akkoord met Shaip Privacybeleid en Algemene Voorwaarden en geef mijn toestemming om B2B-marketingcommunicatie van Shaip te ontvangen.