Anonimiseer ongestructureerde gezondheidszorggegevens

De volledige gids voor het de-identificeren van ongestructureerde gezondheidszorggegevens

Het analyseren van gestructureerde data kan helpen bij betere diagnose en patiëntenzorg. Het analyseren van ongestructureerde data kan echter revolutionaire medische doorbraken en ontdekkingen aanwakkeren.

Dit is de kern van het onderwerp dat we vandaag zullen bespreken. Het is erg interessant om te zien dat er zoveel radicale vooruitgang is geboekt op het gebied van gezondheidszorgtechnologie met slechts 10-20% van de bruikbare gezondheidszorggegevens.

Statistieken laten zien dat meer dan 90% van de data in dit spectrum ongestructureerd is, wat zich vertaalt naar data die minder bruikbaar is en moeilijker te begrijpen, interpreteren en toepassen. Van analoge data zoals een doktersrecept tot digitale data in de vorm van medische beeldvorming en audiovisuele data, ongestructureerde data zijn van verschillende typen.

Zulke enorme brokken ongestructureerde data herbergen ongelooflijke inzichten die de vooruitgang in de gezondheidszorg met tientallen jaren kunnen versnellen. Of het nu gaat om het helpen ontdekken van medicijnen voor levensbedreigende auto-immuunziekten of data die zorgverzekeraars kunnen helpen bij risicobeoordelingen, ongestructureerde data kunnen de weg vrijmaken voor onbekende mogelijkheden.

Wanneer dergelijke ambities bestaan, worden de interpreteerbaarheid en interoperabiliteit van zorggegevens cruciaal. Met strenge richtlijnen en de handhaving van wettelijke voorschriften zoals GDPR en HIPAA, wordt het anonimiseren van zorggegevens onvermijdelijk.

We hebben al een uitgebreid artikel gepubliceerd over het ontrafelen van gestructureerde en ongestructureerde zorggegevens . Er is ook een apart (lees: uitgebreid) artikel over het anonimiseren van zorggegevens . We raden u aan deze artikelen te lezen voor een compleet beeld, aangezien we dit artikel zullen gebruiken voor een apart deel over het anonimiseren van ongestructureerde gegevens.

Uitdagingen bij het de-identificeren van ongestructureerde data

Zoals de naam al doet vermoeden, is ongestructureerde data niet georganiseerd. Het is verspreid over verschillende formaten, bestandstypen, groottes, contexten en meer. Het feit dat ongestructureerde data bestaat in de vorm van audio, tekst, medische beelden, analoge gegevens en meer, maakt het des te lastiger om persoonsgegevens (PII) te identificeren, wat essentieel is voor het anonimiseren van ongestructureerde data.

Om u een idee te geven van de fundamentele uitdagingen, volgt hier een korte lijst:

Uitdagingen bij het de-identificeren van ongestructureerde data

  • Contextueel begrip – waar het voor een AI-stakeholder moeilijk is om de specifieke context achter een bepaald deel of aspect van ongestructureerde data te begrijpen. Bijvoorbeeld, begrijpen of een naam een ​​bedrijfsnaam, de naam van een persoon of een productnaam is, kan een dilemma opleveren over de vraag of deze geanonimiseerd moet worden.  
  • Niet-tekstuele gegevens – waarbij het identificeren van auditieve of visuele signalen voor namen of PII's een ontmoedigende taak kan zijn, aangezien een belanghebbende mogelijk uren en uren aan beeldmateriaal of opnamen moet doornemen om te proberen kritische aspecten te anonimiseren. 
  • Dubbelzinnigheid – dit geldt met name in de context van analoge data zoals een doktersrecept of een ziekenhuisinschrijving in een register. Van handschrift tot beperkingen van expressie in natuurlijke taal, het zou data-de-identificatie een complexe taak kunnen maken. 

Best practices voor de-identificatie van ongestructureerde gegevens

Het proces van het verwijderen van persoonsgegevens uit ongestructureerde data verschilt aanzienlijk van het anonimiseren van gestructureerde data , maar is niet onmogelijk. Door een systematische en contextuele aanpak kan het potentieel van ongestructureerde data optimaal worden benut. Laten we eens kijken naar de verschillende manieren waarop dit kan worden bereikt.

Best practices voor de-identificatie van ongestructureerde gegevens

Beeldbewerking: Dit betreft medische beeldgegevens en omvat het verwijderen van patiëntidentificaties en het vervagen van anatomische referentiepunten en delen van afbeeldingen. Deze worden vervangen door speciale tekens, zodat de diagnostische functionaliteit en bruikbaarheid van de beeldgegevens behouden blijven.

Patroonherkenning: Enkele van de meest voorkomende persoonsgegevens, zoals namen, contactgegevens en adressen, kunnen worden gedetecteerd en verwijderd door vooraf gedefinieerde patronen te bestuderen.

Differentiële privacy of dataverstoring: Dit omvat het opnemen van gecontroleerde ruis om data of kenmerken te verbergen die kunnen worden herleid tot een individu. Deze ideale methode zorgt niet alleen voor de-identificatie van data, maar ook voor het behouden van de statistische eigenschappen van de dataset voor analyses. 

Gegevensanonimisering: Dit is een van de meest betrouwbare en effectieve manieren om persoonsgegevens uit ongestructureerde data te verwijderen. Dit kan op twee manieren worden geïmplementeerd:

  • Leren onder toezicht – waarbij een model is getraind om tekst of data te classificeren als PII of niet-PII
  • Niet-gecontroleerd leren – waarbij een model wordt getraind om autonoom te leren patronen te detecteren bij het identificeren van PII's

Deze methode waarborgt de privacy van patiënten , terwijl menselijke tussenkomst behouden blijft voor de meest overbodige aspecten van de taak. Belanghebbenden en aanbieders van zorggegevens die machine learning-technieken inzetten om ongestructureerde data te anonimiseren, kunnen eenvoudigweg een kwaliteitsborgingsproces met menselijke tussenkomst hanteren om de eerlijkheid, relevantie en nauwkeurigheid van de resultaten te garanderen.

Datamaskering: Datamaskering is de digitale term voor het anonimiseren van zorggegevens, waarbij specifieke identificatoren generiek of vaag worden gemaakt door middel van specifieke technieken zoals:

  • Tokenisatie – waarbij PII's worden vervangen door tekens of tokens
  • Generalisatie – door specifieke PII-waarden te vervangen door generieke/vage waarden
  • Schudden – door PII's te vermengen om ze dubbelzinnig te maken

Deze methode kent echter een beperking: met een geavanceerd model of een geavanceerde aanpak kunnen gegevens opnieuw identificeerbaar worden gemaakt

Uitbesteden aan marktspelers

De enige juiste manier om ervoor te zorgen dat het proces van anonimisering van ongestructureerde data waterdicht, foutloos en conform de HIPAA-richtlijnen verloopt, is door deze taken uit te besteden aan een betrouwbare dienstverlener zoals Shaip . Met geavanceerde modellen en strikte kwaliteitsborgingsprotocollen garanderen we dat menselijk toezicht op de gegevensbescherming te allen tijde tot een minimum wordt beperkt.

Omdat we al jaren een marktdominante onderneming zijn, begrijpen we de criticaliteit van uw projecten. Neem daarom vandaag nog contact met ons op om uw ambities op het gebied van gezondheidszorg te optimaliseren met door Shaip geanonimiseerde gezondheidszorggegevens.

Vond je dit artikel interessant? Volg Shaip op LinkedIn voor meer updates.

Sociale Share