Het opbouwen van een dataset met gezichtsbeelden van niet-EU/VK met diversiteit in leeftijdsontwikkeling
Een tijdgescheiden corpus van gezichtsafbeeldingen met 1,205 deelnemers om de eerlijkheid en robuustheid van computer vision-modellen te versterken.
project Overzicht
Een wereldwijd technologiebedrijf dat gezichtsgerichte AI ontwikkelt voor veiligheid, personalisatie en identiteitservaringen, wilde een dataset buiten de EU/het VK met tijdsgescheiden foto's om vooringenomenheid te verminderen en de veerkracht van het model te verbeteren op het gebied van leeftijd, omgeving en accessoires.
De klant werkte samen met Shaip om een grote dataset met gezichtsafbeeldingen te verzamelen, te beheren en te valideren, waarbij elke deelnemer zowel recente als oudere foto's aanleverde. Het doel was om de natuurlijke veroudering vast te leggen, met strikte controle op herkomst buiten de EU/het VK en een evenwichtige verdeling tussen geslacht en leeftijd.
Key Stats
Deelnemers
1,205 (alleen niet-EU/VK, 50/50 geslacht ±10–15%)
Leeftijdsmix
40% (10–29), 40% (30–49), 20% (50+) ±10–15% tolerantie
Dekking
Zuid-/Zuidoost-Azië, Noord- en Noord-/Oost-Afrika, Singapore, Zuid-Amerika
Timeline
19 weken
Challenges
Geografische beperking
Uitsluitend bronnen van niet-EU/VK-populaties gebruiken en EU/VK-reisafbeeldingen vermijden.
Evenwichtige quota op schaal
Er waren 1,205 deelnemers met een strikte tolerantie voor geslacht en leeftijd.
Tijdgescheiden bewijs
Zorgen dat elk identiteitsbewijs zowel recente als historische foto's bevat, afgestemd op de leeftijdscategorie.
Operationele kwaliteit
Handhaving van minimale limieten voor afbeeldings-/gezichtsgrootte, variëteit en duplicatie zonder de doorvoer te vertragen.
Het resultaat
1. Landenpanelen en herkomstcontroles
We hebben inkoopteams op landniveau opgezet in de beoogde regio's en partners getraind in herkomstregels (alleen buiten de EU/het VK). Foto's werden gescreend op risico's met betrekking tot de herkomst door middel van metadata (jaar, locatieaanduidingen) en verklaringen van de inzender, waardoor lekkage uit de EU/het VK vóór de kwaliteitscontrole werd verminderd. Dit sluit aan bij de beproefde werkwijze van Shaip om risicocontroles vroegtijdig uit te voeren om de doorvoer in het vervolgproces te waarborgen.
2. Ontwerp voor het vastleggen van leeftijdsprogressie
In plaats van "vraag om 20 afbeeldingen", hebben we een indieningsproces met twee stappen ontworpen dat deelnemers begeleidde bij:
- Spoor A (Recent): foto's van de laatste twee jaar;
- Spoor B (Historisch): oudere foto's die passen bij de leeftijdscategorie van de deelnemer op het moment van inzending (bijv. periode 2-10/15/20 jaar).
Het portaal gaf gebruikers een zetje in de rug met voorbeelden (binnen/buiten, hoeken, accessoires) om de variatie te vergroten zonder te veel te specificeren.
3. Diversiteitsorkestratie en quota-bescherming
Een realtime dashboard met quota-overzichten monitorde de inschrijvingen per geslacht, leeftijdsgroep en geografische locatie , waarbij de instroom werd stopgezet zodra een stratum de geplande limieten bereikte. Dit voorkwam herwerk in een laat stadium van de cyclus en weerspiegelt Shaips standaardaanpak van gestratificeerde inschrijving + blokkeringen die in eerdere biometrische datasets werd gebruikt om een evenwichtige vertegenwoordiging te garanderen.
4. Kwaliteitspijplijn (menselijke betrokkenheid + geautomatiseerde voorafgaande controles)
- Automatische poorten: gezichtsdetectie + minimale drempelwaarden voor beeldgrootte, basiscontroles op onscherpte/ruis en clustering op dezelfde dag om potentiële duplicaten vroegtijdig te signaleren.
- Menselijke QA-niveaus: gevalideerde reviewers op beeldniveau onderwerp exclusiviteit (alleen primaire deelnemer), scène-/hoekvariatieen geen verfraaiingsfilters; CQA-auditors controleren steekproefsgewijs batches vóór acceptatie. Dit meerlaagse QA spiegelt Shaip's gepubliceerde biometrische dataprogramma's.
5. Naleving en toestemming
Inschrijving van 20 jaar en ouder met ondertekende toestemming; gevallen jonger dan 20 jaar worden alleen geaccepteerd met toestemming van een voogd. We hebben de aanwezigheid van toestemming vastgelegd in de metadata en de checklists van de beoordelaars afgestemd op de velden voor geschiktheid en toestemming , waardoor de controleerbaarheid gewaarborgd is.
6. Metadata en traceerbaarheid
We leverden metadata op deelnemers- en beeldniveau (ID-koppelingen, demografische gegevens, nationaliteit/woonplaats, jaar van de foto, indieningsdatum, enz.) en standaardiseerde veldnamen om het labelen en evalueren in latere fasen te vereenvoudigen . Dit volgt de beste werkwijze van Shaip voor het toevoegen van uitgebreide metadata aan biometrische datasets.
7. Gefaseerde levering aan de risicoschaal
Een plan van 8 batches begon met een kalibratieset van 10 deelnemers , gevolgd door een gecontroleerde opschaling. Feedback van de klant na batch 1 leidde tot aanpassingen in de beoordelingscriteria, waarna het aantal deelnemers in voorspelbare stappen werd verhoogd tot 1,205 deelnemers in ongeveer 19 weken.
Project bereik
| Afmeting | Wat we hebben geleverd |
|---|---|
| Bevolking | 1,205 deelnemers van buiten de EU/het VK met een evenwichtige verdeling van geslacht en leeftijd. |
| Beschrijving | ≥20 afbeeldingen per deelnemer: recent + historisch om het leeftijdsverloop te coderen; gevarieerde scènes, hoeken en accessoires. |
| Kwaliteitsoperaties | Geautomatiseerde voorafgaande controles + menselijke meerlaagse QA (duplicatiecontroles; onderwerpexclusiviteit; filterafwijzing). |
| Compliant | Verificatie van herkomst buiten de EU/VK; toestemmingsbeheer en validatie van geschiktheid. |
| Metadata | Deelnemer- en afbeeldingsattributen voor traceerbaarheid en downstream ML-evaluatie. |
| Verzending | 8 gefaseerde batches, beginnend met kalibratie en vervolgens stabiele levering aan het einddoel. |
De uitkomst
- Gebalanceerd, auditklaar corpus: Demografische quota's zijn binnen de tolerantiegrens gehaald; Niet-EU/VK-herkomst wordt gehandhaafd op alle afbeeldingen voor conforme training.
- Variabiliteit in modelvorm: Tijdgescheiden beelden, diverse omgevingen/hoeken en accessoiredekking ondersteunen robuustheidstesten en biasanalyse.
- Operationele voorspelbaarheid: Kalibratie eerste uitrol + quota-richtlijnen verminderden de herbewerking en waarborgden de tijdlijn voor het behalen van de volledige doelstelling van 1,205 deelnemers.
- Downstream-efficiëntie: Dankzij uitgebreide metagegevens en consistente bestandshygiëne werd het traject naar annotatie en benchmarkconstructie verkort, conform Shaip's biometrische datasethandleidingen.
Shaip transformeerde een complexe dataset met gezichtsgegevens van buiten de EU/het VK tot een evenwichtig, auditklaar corpus. Hun leeftijdsopbouw en gelaagde QA gaven ons CV-team schone, diverse data waarop we konden vertrouwen – zonder planningsrisico.