Arabisch & Thais & Vietnamees & Hindi & Engels & Chinees Taal Dataset
Diverse tekstherkenningsdatasets voor geavanceerde OCR-toepassingen: borden, menu's en meer
Gebruiksscenario: OCR
Formaat: Afbeelding
Aantal: 150
Annotatie: Ja
Beschrijving: Dataset met talen zoals Arabisch, Thais, Vietnamees, Hindi, Engels en Chinees.
Gebruiksscenario: OCR
Formaat: Afbeelding
Aantal: 1
Annotatie: Ja
Beschrijving: De dataset met Arabische tekst bevat een verzameling tekstvoorbeelden geschreven in het Arabisch. Deze omvat diverse soorten content, zoals nieuwsartikelen, berichten op sociale media, literatuur en dialogen, met uiteenlopende onderwerpen en schrijfstijlen. Deze dataset wordt gebruikt voor taken zoals natuurlijke taalverwerking (NLP), tekstclassificatie, sentimentanalyse en machinale vertaling in Arabische taaltoepassingen.
Gebruiksscenario: OCR
Formaat: Afbeelding
Aantal: 38
Annotatie: Ja
Beschrijving: Dataset met Chinese, Engelse, Tibetaanse en Oeigoerse talen.
Gebruiksscenario: OCR
Formaat: Afbeelding
Aantal: 60
Annotatie: Ja
Beschrijving: De dataset met Chinese en Engelse menukaarten bevat afbeeldingen of tekstvoorbeelden van restaurantmenu's in zowel het Chinees als het Engels. De dataset bevat diverse lettertypen, lay-outs en menustructuren, met tweetalige namen van gerechten, beschrijvingen en prijzen. Deze dataset is nuttig voor taken zoals optische tekenherkenning (OCR), machinale vertaling en het digitaliseren van menu's in meertalige omgevingen.
Gebruiksscenario: OCR
Formaat: Afbeelding
Aantal: 3
Annotatie: Ja
Beschrijving: De dataset met handgeschreven Chinese teksten bevat voorbeelden van handgeschreven Chinese teksten, waaronder composities, essays en andere langere teksten. De dataset omvat diverse handschriftstijlen en complexiteitsniveaus en wordt gebruikt voor taken zoals handschriftherkenning, tekstanalyse en het trainen van machine learning-modellen.
Gebruiksscenario: OCR
Formaat: Afbeelding
Aantal: 1
Annotatie: Ja
Beschrijving: De Chinese WIFI-promptdataset bestaat uit tekstvoorbeelden van wifi-prompts en inlogschermen in het Chinees. Deze dataset bevat doorgaans diverse prompts, instructies en foutmeldingen met betrekking tot het verbinden met of beheren van wifi-netwerken. De dataset wordt gebruikt voor taken zoals tekstherkenning, natuurlijke taalverwerking en het verbeteren van gebruikersinterfaces voor netwerkverbindingen.
Gebruiksscenario: OCR
Formaat: Afbeelding
Aantal: 12
Annotatie: Ja
Beschrijving: De dataset met handgeschreven teksten in het Engels en Chinees bevat voorbeelden van handschrift in zowel het Engels als het Chinees, met diverse schrijfstijlen en complexe karakters. Deze dataset wordt doorgaans gebruikt voor het trainen en evalueren van modellen voor handschriftherkenning, ter ondersteuning van meertalige tekstanalyse en ander gerelateerd onderzoek. De dataset bevat een breed scala aan karakters, cijfers, woorden en zinnen in beide talen.
Gebruiksscenario: OCR
Formaat: Afbeelding
Aantal: 30
Annotatie: Ja
Beschrijving: De dataset met Engelse en Chinese winkelreclameborden bevat afbeeldingen van winkelreclameborden met zowel Engelse als Chinese tekst. De dataset toont diverse elementen zoals winkelnamen, advertenties, promoties en routebeschrijvingen, weergegeven in verschillende lettertypen, stijlen en formaten. Deze dataset wordt gebruikt voor taken zoals tekstdetectie en -herkenning, het begrijpen van meertalige scènes en het verbeteren van computervisiemodellen voor het interpreteren van tweetalige reclameborden.
Gebruiksscenario: OCR
Formaat: Afbeelding
Aantal: 50
Annotatie: Ja
Beschrijving: De dataset met tekst in het Engels en Chinees vanuit verschillende hoeken bevat afbeeldingen van tekst die vanuit diverse hoeken en oriëntaties wordt weergegeven. De dataset bevat tekst uit bronnen zoals borden, advertenties en documenten die niet in de standaard horizontale indeling worden gepresenteerd. Deze dataset wordt gebruikt voor het trainen en evalueren van modellen voor tekstdetectie en -herkenning, met name modellen die tekst in niet-traditionele oriëntaties en perspectieven kunnen verwerken.
Gebruiksscenario: OCR
Formaat: Afbeelding
Aantal: 20
Annotatie: Ja
Beschrijving: De dataset met Engelse menu's bevat afbeeldingen of tekstvoorbeelden van restaurantmenu's in het Engels. De dataset bevat een verscheidenheid aan lettertypen, lay-outs en opmaakstijlen, met inhoud variërend van gerechtnamen tot beschrijvingen en prijzen. Deze dataset wordt vaak gebruikt voor taken zoals optische tekenherkenning (OCR), tekstextractie en het digitaliseren van menu's in toepassingen in de voedingssector.
Gebruiksscenario: OCR
Formaat: Afbeelding
Aantal: 33
Annotatie: Ja
Beschrijving: De dataset 'English Scenes Text' bestaat uit afbeeldingen van natuurlijke scènes met ingebedde Engelse tekst. De tekst verschijnt in verschillende vormen, zoals borden, reclameborden en posters, vaak in uiteenlopende lettertypen, groottes en oriëntaties. Deze dataset wordt veel gebruikt voor het trainen en testen van modellen voor tekstdetectie, -herkenning en scènebegrip.
Gebruiksscenario: Document-AI
Formaat: HEIC (afbeeldingen) & .mov (video's)
Aantal: 94053
Annotatie: Nee
Beschrijving: Live foto's met handgeschreven tekst voor Japans, Koreaans en Russisch.
Opnameapparaat: iPhone- en iPad-camera
Opnameomstandigheden: - Sterke verlichting/verblinding - Cameraflitser aan - Gekleurd licht - Weinig licht, geen cameraflitser - Normaal
Gebruiksscenario: OCR
Formaat: Afbeelding
Aantal: 40
Annotatie: Ja
Beschrijving: De dataset met Japanse en Koreaanse tekst bevat tekstvoorbeelden in zowel het Japans als het Koreaans. De dataset omvat een breed scala aan inhoud, zoals zinnen, woordgroepen en woorden, in diverse contexten en stijlen. Deze dataset wordt gebruikt voor taken zoals natuurlijke taalverwerking (NLP), machinale vertaling en tekstanalyse in meertalige toepassingen.
Gebruiksscenario: Document-AI
Formaat: HEIC (afbeeldingen) & .mov (video's)
Aantal: 23930
Annotatie: Nee
Beschrijving: Live foto's met handgeschreven tekst voor Japans, Koreaans en Russisch.
Opnameapparaat: iPhone- en iPad-camera
Opnameomstandigheden: - Sterke verlichting/verblinding - Cameraflitser aan - Gekleurd licht - Weinig licht, geen cameraflitser - Normaal
Gebruiksscenario: Tekst + audiovisueel (meertalig / OCR / NLP)
Formaat: Video's
Aantal: meer dan 100 collegevideo's + lange PowerPoint-presentaties
Annotatie: Nee
Beschrijving: Chinese boeken, Engelse boeken, tijdschriften, openbaar beleid, romans, kinderboeken, Kantonese audio+tekst, collegevideo's+PPT, lange video's, een half miljard boeken, vraag-antwoordparen, artikelen
Wij gebruiken cookies om uw ervaring op onze site te verbeteren. Door onze site te gebruiken, stemt u in met cookies.
Beheer hieronder uw cookievoorkeuren:
Essentiële cookies maken basisfuncties mogelijk en zijn noodzakelijk voor de goede werking van de website.
Met Google Tag Manager kunt u marketingtags op uw website eenvoudig beheren zonder dat u de code hoeft te wijzigen.
Statistische cookies verzamelen anoniem informatie. Deze informatie helpt ons te begrijpen hoe bezoekers onze website gebruiken.
Google Analytics is een krachtig hulpmiddel waarmee u websiteverkeer kunt volgen en analyseren, zodat u weloverwogen marketingbeslissingen kunt nemen.
Service-URL: policies.google.com (opent in een nieuw venster)
Marketingcookies worden gebruikt om bezoekers van websites te volgen. De bedoeling is om advertenties te tonen die relevant en boeiend zijn voor de individuele gebruiker.
Google Ads is een online advertentieplatform waarmee bedrijven gerichte advertenties kunnen maken die worden weergegeven in de zoekresultaten van Google en op partnerwebsites.
Service-URL: policies.google.com (opent in een nieuw venster)
HubSpot is een alles-in-één platform voor marketing, verkoop en klantenservice dat de bedrijfsgroei stroomlijnt.
Service-URL: legal.hubspot.com (opent in een nieuw venster)
Meer informatie vindt u in ons cookiebeleid en ons privacybeleid.