OCR-tekstdetectie en transcriptie-annotatie
Hoe Shaip woord- en karaktergebaseerde transcriptie-annotaties leverde voor diverse tekstbronnen — gedrukte documenten, handschrift, bewegwijzering, kentekenplaten, bonnen — opgebouwd tot een productieklare OCR- en documentintelligentiedataset met een nauwkeurigheid van 99%.
project Overzicht
Naarmate OCR zich verder ontwikkelt dan schone, afgedrukte documenten en zich richt op tekst en documentinformatie uit de echte wereld, had de klant behoefte aan een annotatiepipeline die diverse tekstsoorten, lettertypen, oriëntaties, talen en oppervlaktecondities met zowel ruimtelijke als karakterprecisie kan verwerken.
Shaip ontwikkelde de complete annotatiepipeline, die het plaatsen van bounding boxes op woordniveau, exacte karaktertranscriptie, het toevoegen van meerdere attributen en een dubbele ruimtelijke + transcriptie-QA omvat. Hiermee werden modelklare OCR-datasets geproduceerd voor meer dan 10 verschillende tekstbronnen.
Key Stats
Annotatie per afbeelding
Honderden woorden
Nauwkeurigheidsdrempel
99%
Tekstbronnen
10+
Attribuutlagen
5
Challenges
- annoteren elke zichtbare tekstinstantie op woordniveau — honderden per dicht beeld
- De combinatie van ruimtelijke begrenzingskaderprecisie with exacte transcriptie op karakterniveau parallel
- Behandeling gebogen, perspectiefvervormde en gedraaide tekst op reclameborden en productetiketten
- transcriberen vervaagd, met weinig contrast en gedeeltelijk afgedekt. woorden zonder onleesbare tekens te hoeven raden
- Beheren tekst in gemengde talen en meerdere schriften binnen dezelfde afbeelding
Het resultaat
Ruimtelijke annotatie op woordniveau
Elk zichtbaar tekstfragment in elke afbeelding werd afzonderlijk geannoteerd met een nauwsluitend kader op woordniveau, waarmee de exacte ruimtelijke locatie van elk tekstelement werd vastgelegd. Bij afbeeldingen met veel tekst, zoals bonnen of formulieren, betekende dit honderden afzonderlijke annotaties per afbeelding, waarbij elke annotatie de nauwkeurigheid van de basislijnuitlijning behield.
Transcriptie op tekenniveau
Naast het kader transcribeerden annotatoren de exacte tekstinhoud van elk woord, inclusief cijfers, speciale tekens, leestekens en alfanumerieke combinaties. Deze dubbele workflow – ruimtelijk + transcriptie – werd parallel uitgevoerd met consistentieregels voor beide lagen.
Dekking vanuit meerdere bronnen
De dekking omvatte een zeer diverse reeks bronnen: gedrukte documenten, handgeschreven notities, straatnaamborden, productetiketten, kentekenplaten, winkelgevels, reclameborden, bonnen, facturen, menu's en formuliervelden. Elk brontype had zijn eigen annotatierichtlijnen, afgestemd op de visuele kenmerken ervan.
5-laags attribuutlabeling
Elk geannoteerd tekstgebied werd verrijkt met attributen die betrekking hadden op tekstoriëntatie (horizontaal, verticaal, diagonaal), taal en schriftsoort, teksthelderheid (duidelijk leesbaar, gedeeltelijk leesbaar, volledig onleesbaar), lettertype (gedrukt versus handgeschreven) en tekstachtergrondtype (effen, met patroon, complex). Deze rijke attributenlaag stelt het getrainde model in staat om diverse tekstomstandigheden uit de praktijk te verwerken, veel verder dan standaard OCR voor documenten.
Zichtbaarheidsdrempel en dubbele kwaliteitscontrole
Strikte richtlijnen bepaalden de minimale zichtbaarheidsdrempels: onleesbare tekst werd gemarkeerd in plaats van te worden gegokt, waardoor de integriteit van de dataset gewaarborgd bleef. Elke geannoteerde afbeelding doorliep een tweeledig kwaliteitscontroleproces, waarbij de precisie van de begrenzingskaders werd gecontroleerd en de nauwkeurigheid van de transcriptie werd gevalideerd, met een nauwkeurigheidsdrempel van 99% voor beide lagen.
Project bereik
| Gegevenssettype | Annotatieniveau | Bronnen | Attributen | QA | Nauwkeurigheid |
|---|---|---|---|---|---|
| OCR-tekstdetectie + transcriptie | Woordvakken + karaktertranscriptie | Meer dan 10 brontypen | 5 attribuutlagen | Dubbele ruimtelijke + transcriptie QC | 99% |
Resultaten
- Opgericht een dubbele transcriptiepipeline op woord- en karakterniveau voor OCR AI
- Gestandaardiseerde Meer dan 10 tekstbronnen verspreid over documenten, scènebeschrijvingen en handschrift
- Geleverd 5 attribuutlagen voor oriëntatie, taal, duidelijkheid, lettertype en achtergrond
- onderhouden 99% nauwkeurigheidspoort over zowel ruimtelijke als transcriptie-QA-lagen
- De client is ingeschakeld documentdigitalisering, OCR voor de detailhandel, navigatie, bankwezen en juridische dienstverlening AI-toepassingen
Al met al heeft Shaip geholpen om een vereiste voor tekstannotatie uit meerdere bronnen om te zetten in een gestructureerde, productiegereed OCR-pipeline. Deze pipeline is in staat om documentdigitalisering, tekstdetectie in omgevingen, retail intelligence, bankautomatisering en AI voor naleving van wet- en regelgeving te ondersteunen, met zowel ruimtelijke als transcriptieprecisie.
Shaip kon de OCR-uitzonderingen aan die de meeste aanbieders niet aankunnen: gebogen tekst op borden, gemengde schriften, vervaagde bonnen en handgeschreven notities. Hun dubbele kwaliteitscontrole op zowel de begrenzingskaders als de transcripties leverde ons trainingsdata op die we konden gebruiken.
— Directeur, Document AI