Geanonimiseerde elektronische patiëntendossiers (EPD-datasets) voor AI- en ML-projecten

Commercieel gelicentieerde, HIPAA-conforme elektronische patiëntendossiergegevens – klaar voor klinische AI, NLP en voorspellende modellen.

Gegevens over elektronische medische dossiers (ehr).

Wat zijn EHR-gegevens en waarom zijn ze belangrijk voor AI?

EHR-datasets in ai/ml

Elektronische patiëntendossiers (EPD's) zijn digitale patiëntendossiers die door zorgverleners worden bijgehouden gedurende het gehele zorgtraject – van ziekenhuizen en poliklinieken tot specialistische praktijken en laboratoria. In tegenstelling tot elektronische medische dossiers (EPD's), die momentopnamen van één zorgverlener zijn, omvatten EPD-gegevens het volledige zorgtraject van de patiënt en leggen ze interacties vast in verschillende zorgomgevingen.

De geanonimiseerde EHR-datacatalogus van Shaip omvat beide aspecten en biedt uw team één enkele, aan de regelgeving voldoenende bron voor het volledige spectrum van AI-ontwikkeling in de gezondheidszorg.

EHR-datasets bevatten twee cruciale gegevenstypen voor de ontwikkeling van AI: gestructureerde gegevens (demografische gegevens, ICD-10-diagnosecodes, DRG-codes, medicatielijsten, laboratoriumwaarden, vitale functies) en ongestructureerde gegevens (klinische aantekeningen, ontslagbrieven, radiologierapporten, dictaten van artsen). Ongeveer 80% van de informatie in EHR's is ongestructureerd, waardoor het de belangrijkste bron is voor het trainen van klinische NLP-modellen.

Vind de juiste elektronische medische dossiers (EPD) gegevens voor uw gezondheidszorg AI

Verbeter uw machine learning-modellen met de beste trainingsdata. Shaip biedt commercieel verkrijgbare, geanonimiseerde datasets met elektronische patiëntendossiers (EPD's), speciaal ontworpen voor AI- en machine learning-teams. Onze kant-en-klare EPD-datacatalogus biedt gestructureerde, onderzoeksklare patiëntendossiers voor meer dan 20 medische specialismen – inclusief diagnoses, recepten, laboratoriumresultaten, radiologierapporten, vaccinatiegeschiedenis en klinische aantekeningen – allemaal volledig geanonimiseerd volgens de HIPAA Safe Harbor- en GDPR-normen.

Of u nu klinische beslissingsondersteunende systemen bouwt, NLP-modellen traint op basis van aantekeningen van artsen, algoritmes ontwikkelt voor ziektevoorspelling of tools voor zorgautomatisering inzet, de EHR-datasets van Shaip bieden u de diepte, diversiteit en compliance-garantie die uw AI-project vereist. Direct beschikbaar voor licentieverlening, selectie van een aangepaste cohort of download van een voorbeeld.

Kant-en-klare elektronische medische dossiers (EPD):

  • 5.1M+ Records en audiobestanden van artsen in 31 specialismen
  • Echte gouden standaard medische dossiers om klinische NLP en andere Document AI-modellen te trainen
  • Metadata-informatie zoals MRN (geanonimiseerd), opnamedatum, ontslagdatum, verblijfsduurdagen, geslacht, patiëntklasse, betaler, financiële klasse, staat, ontslagbeschikking, leeftijd, DRG, DRG-beschrijving, $ vergoeding, AMLOS, GMLOS, risico op sterfte, ernst van ziekte, tandbaars, ziekenhuispostcode, enz.
  • Medische dossiers uit verschillende Amerikaanse staten en regio's - Noordoost (46%), Zuid (9%), Midwest (3%), West (28%), Overige (14%)
  • Medische dossiers die behoren tot alle gedekte patiëntklassen - intramuraal, poliklinisch (klinisch, revalidatie, terugkerende, chirurgische dagopvang), noodgevallen.
  • Medische dossiers behorend tot alle leeftijdsgroepen van patiënten <10 jaar (7.9%), 11-20 jaar (5.7%), 21-30 jaar (10.9%), 31-40 jaar (11.7%), 41-50 jaar (10.4%) ), 51-60 jaar (13.8%), 61-70 jaar (16.1%), 71-80 jaar (13.3%), 81-90 jaar (7.8%), 90+ jaar (2.4%)
  • Patiënt Geslachtsratio van 46% (mannelijk) en 54% (vrouwelijk)
  • PII geredigeerde documenten die voldoen aan de Safe Harbor-richtlijnen in overeenstemming met HIPAA
EPD-gegevens per locatie
Lokatie Tekstdocumenten
Noord-Oost 4,473,573
Zuiden 1,801,716
Middenwesten 781,701
West 1,509,109
EPD-gegevens per hoofddiagnosecategorie
Belangrijke diagnosecategorie Tekstdocumenten
Alcohol/drugsgebruik en door alcohol/drugs geïnduceerde organische psychische stoornissen48,717
Totaal inclusief alles (gevallen met en zonder MDC-categorie)8,566,687
Gevallen zonder vergoeding gegenereerd (MDC niet gespecificeerd)790,697
Poliklinische gevallen (MDC niet gespecificeerd)1,980,606
Gevallen met een speciale tandbaars zoals 3M (MDC niet gespecificeerd)1,619,682
Totaal met MDC4,175,702
Alcohol-/drugsgebruik of geïnduceerde psychische stoornissen48,717
Brandwonden444
Oog3,549
Mannelijk voortplantingssysteem9,230
Humaan immunodeficiëntievirusinfecties12,422
Myeloproliferatieve ziekten en aandoeningen, slecht gedifferentieerde neoplasmata15,620
Factoren die de gezondheidsstatus en andere contacten met gezondheidsdiensten beïnvloeden21,294
Vrouwelijk voortplantingssysteem17,010
Oor, neus, mond en keel22,987
Meerdere significante trauma's27,902
Bloedsomloop589,730
Bloed, bloedvormende organen en immunologische aandoeningen48,990
Verwondingen, vergiftigingen en giftige effecten van medicijnen64,097
Huid, onderhuids weefsel en borst89,577
Hepatobiliair systeem en pancreas127,172
Endocriene, voedings- en stofwisselingsziekten en -stoornissen142,808
Pasgeborenen en andere pasgeborenen met aandoeningen die afkomstig zijn uit de perinatale periode163,605
Zwangerschap, bevalling en het kraambed165,303
Nier en urinewegen209,561
Geestelijke ziekten en stoornissen282,501
Zenuwgestel316,243
spijsverteringsorganen346,369
Musculoskeletaal systeem en bindweefsel329,344
Luchtwegen561,983
Infectieuze en parasitaire ziekten559,244

We behandelen alle soorten gegevenslicenties, dwz tekst, audio, video of afbeelding. De datasets bestaan ​​uit medische datasets voor ML: Physician Dictation Dataset, Physician Clinical Notes, Medical Conversation Dataset, Medical Transcription Dataset, Doctor-Patient Conversation, Medical Text Data, Medical Images – CT Scan, MRI, Ultra Sound (verzameld op basis van aangepaste vereisten) .

Toepassingen in de praktijk van EPD-datasets in AI/ML

  • Ziektevoorspelling en diagnose: Train AI-modellen om ziektes zoals diabetes, kanker en hart- en vaatziekten te voorspellen.
  • Ondersteuning bij klinische beslissingenModellen trainen om aanbevelingen voor diagnoses te genereren, interacties tussen geneesmiddelen aan te geven en te helpen bij de behandelplanning met behulp van gestructureerde gegevens uit elektronische patiëntendossiers.
  • Gepersonaliseerde geneeskunde: Gebruik demografische en diagnostische gegevens om gepersonaliseerde behandelplannen aan te bevelen.
  • Automatisering van de gezondheidszorg: Automatiseer administratieve taken zoals het inplannen van afspraken of factureren met NLP-hulpmiddelen die zijn getraind op basis van EPD-datasets.
  • Voorspellende modellen voor de gezondheidszorg — Ontwikkel risicostratificatie- en ziektevoorspellingsmodellen met behulp van longitudinale patiëntendossiers, DRG-codes en scores voor de ernst van de ziekte. 
  • Real-World Evidence (RWE)-onderzoeken — Genereer bewijsmateriaal na marktintroductie en inzichten in farmacovigilantie door uitkomstgegevens uit elektronische patiëntendossiers te analyseren voor verschillende patiëntengroepen.
  • NLP voor klinische aantekeningen — Extraheer entiteiten, aandoeningen en procedures uit ongestructureerde aantekeningen van artsen en ontslagverslagen met behulp van geannoteerde trainingsgegevens uit elektronische patiëntendossiers.

Waarom Shaip kiezen voor EPD-datasets?

Deskundig personeel

Vakkundige professionals zorgen voor nauwkeurige en hoogwaardige data-annotatie.

Regulatory Compliance

Volledig geanonimiseerde datasets die voldoen aan HIPAA en AVG.

concurrerende prijzen

Kosteneffectieve oplossingen zonder dat dit ten koste gaat van de kwaliteit.

Bias-vrije gegevens

Strikte protocollen voorkomen vooroordelen en zorgen voor betrouwbare AI-resultaten.

Snel en nauwkeurig

Gestroomlijnde processen zorgen voor een snelle levering van uiteenlopende, hoogwaardige gegevens.

Beschikbaarheid & Levering

Hoge netwerk-uptime en tijdige levering van data, services en oplossingen.

Op grote schaal bewezen

Vertrouwd door Google en toonaangevende AI-bedrijven in de gezondheidszorg. Kwaliteitsborging door middel van 6 Sigma Black Belt-processen en beoordeling door medische experts.

Commercieel gereed

De kant-en-klare EHR-catalogus van Shaip is gelicentieerd, geanonimiseerd en kan vandaag nog worden gedownload of geraadpleegd via de Databricks Marketplace.

Volledige levenscyclusondersteuning

Heeft u annotaties nodig bovenop ruwe data? Shaip biedt anonimisering, klinische NER-labeling en data-augmentatie vanuit één partner.

Neem contact met ons op

Kunt u niet vinden wat u zoekt?

Er worden nieuwe kant-en-klare medische datasets verzameld voor alle datatypes 

Neem nu contact met ons op om uw zorgen over het verzamelen van gegevens over gezondheidstrainingen los te laten

  • Dit veld is voor de validatie doeleinden en moet onveranderd worden gelaten.
  • Door te registreren ga ik akkoord met Shaip Privacybeleid en Algemene Voorwaarden en geef mijn toestemming om B2B-marketingcommunicatie van Shaip te ontvangen.

EPD-datasets worden gebruikt om AI-modellen te trainen voor ziektevoorspelling, klinische besluitvorming en gepersonaliseerde behandelingen.

EPD-gegevens worden gebruikt om AI-modellen te trainen voor klinische besluitvormingsondersteuning, ziektevoorspelling, gepersonaliseerde behandelplanning en automatisering van de gezondheidszorg.

Ja, alle EPD-gegevens worden geanonimiseerd om persoonlijk identificeerbare informatie (PII) te verwijderen en te voldoen aan de privacyregelgeving.

Gegevens uit het Elektronisch Patiëntendossier bevatten onder andere gegevens als demografische gegevens van de patiënt, medische voorgeschiedenis, diagnoses, behandelplannen, resultaten van laboratoriumonderzoek, radiologische beelden (bijv. CT, MRI, röntgenfoto's), voorschriften en vaccinatiegegevens.

Ja, de gegevens voldoen aan HIPAA, AVG en andere wereldwijde privacynormen om veilig en ethisch gebruik te garanderen.

Ja, datasets kunnen worden afgestemd op specifieke medische specialismen, regio's, patiëntdemografie of projectvereisten.

Ja, de datasets worden geleverd in standaardformaten (bijv. JSON, CSV) voor eenvoudige integratie in AI- en ML-workflows.

Gegevens worden grondig gevalideerd en aan kwaliteitscontroles onderworpen om de nauwkeurigheid, consistentie en betrouwbaarheid te garanderen.

De kosten zijn afhankelijk van factoren zoals datavolume, maatwerk en projectomvang. We verzoeken u het contactformulier in te vullen met uw wensen om de beste offerte te ontvangen.

De levertijden variëren afhankelijk van de omvang en complexiteit van het project, maar zijn erop gericht om de overeengekomen deadlines te halen.

Met EPD-datasets kunnen AI-systemen betere diagnostiek, voorspellende inzichten en gepersonaliseerde behandelingen bieden, wat leidt tot betere patiëntresultaten en een efficiëntere gezondheidszorg.

Ja, Shaip biedt op maat gemaakte EPD-datasets op basis van specialisme, leeftijdsgroep, geografische locatie of projectvereisten.

Elektronische patiëntendossiers (EPD's) bevatten klinische gegevens van één zorgverlener; elektronische patiëntendossiers (EPD's) omvatten het volledige zorgtraject van meerdere zorgverleners, in verschillende omgevingen en over meerdere tijdsperioden. Shaip biedt zowel EPD- als EPD-datasets aan, met longitudinale gegevens van meerdere zorgverleners beschikbaar voor complexe AI-trainingsvereisten.

Alle gegevens worden geanonimiseerd met behulp van de Safe Harbor-methode van de HIPAA Privacy Rule. Hierbij worden alle 18 persoonsgegevens over de gezondheid (PHI) verwijderd, waaronder naam, geboortedatum, adres en medisch dossiernummer. Het geanonimiseerde MRN-veld blijft behouden voor het koppelen van gegevens binnen de dataset, waardoor longitudinale analyses mogelijk zijn zonder risico op heridentificatie.