Medische datacatalogus voor AI in de gezondheidszorg
Kant-en-klare gezondheidszorg/medische datasets om uw AI-project in de gezondheidszorg een vliegende start te geven
Medische en gezondheidszorgdatasets voor machine learning
Wat omvat de Shaip Medical Data Catalog?
De Shaip Medical Data Catalog is een kant-en-klare, HIPAA-conforme bibliotheek met geanonimiseerde trainingsgegevens uit de gezondheidszorg, die 31 medische specialismen omvat. De catalogus bevat 257,977 uur aan audio-opnamen van artsen, getranscribeerde medische dossiers, elektronische patiëntendossiers en multimodale datasets. Elke dataset is gelicentieerd voor commerciële AI-training en wordt geleverd met Safe Harbor- of Expert Determination-anonimisering.
Audiogegevens dicteren door arts
Onze geanonimiseerde dataset voor de gezondheidszorg bevat audiobestanden van 31 specialismen, opgesteld door artsen, waarin de klinische toestand van patiënten en hun zorgplan worden beschreven op basis van patiënt-artscontacten in een klinische setting.
Kant-en-klare audiobestanden voor dicteren van artsen:
- 257,977 uur aan dataset met spraakdictaties van artsen uit 31 specialismen om spraakmodellen voor de gezondheidszorg te trainen
- Dictaataudio vastgelegd vanaf verschillende apparaten, zoals dictaat via telefoon (54.3%), digitale recorder (24.9%), spraakmicrofoon (5.4%), smartphone (2.7%) en onbekend (12.7%)
- PII geredigeerde audio en transcripties die voldoen aan de Safe Harbor-richtlijnen in overeenstemming met HIPAA
Getranscribeerde medische dossiers
Getranscribeerde medische dossiers omvatten de transcriptie van gesprekken tussen arts en patiënt, transcriptie van medische rapporten en medische beoordelingen. Het helpt bij het in kaart brengen van de medische geschiedenis van de patiënt voor toekomstige bezoeken en dient tevens als referentiepunt voor de artsen. Het helpt bij het evalueren van de huidige toestand van de patiënt en het voorstellen van een geschikte behandeling.
Kant-en-klare getranscribeerde medische dossiers:
- Transcriptie van 257,977 uur real-world doktersdictaat van 31 specialismen om spraakmodellen voor de gezondheidszorg te trainen
- Getranscribeerde medische dossiers van verschillende soorten werk, zoals operatieverslag, ontslagsamenvatting, consultatienota, toelatingsnota, ED-notitie, klinieknota, radiologierapport, enz.
- PII geredigeerde audio en transcripties die voldoen aan de Safe Harbor-richtlijnen in overeenstemming met HIPAA
Elektronische medische dossiers (EPD)
Elektronische medische dossiers of EPD zijn medische dossiers die de medische geschiedenis van de patiënt, diagnoses, recepten, behandelplannen, vaccinatie- of immunisatiedata, allergieën, radiologische beelden (CT-scan, MRI, röntgenstralen) en laboratoriumtests en meer bevatten.
Kant-en-klare elektronische medische dossiers (EPD):
- 5.1M+ Records en audiobestanden van artsen in 31 specialismen
- Echte gouden standaard medische dossiers om klinische NLP en andere Document AI-modellen te trainen
- Metadata-informatie zoals MRN (geanonimiseerd), opnamedatum, ontslagdatum, verblijfsduurdagen, geslacht, patiëntklasse, betaler, financiële klasse, staat, ontslagbeschikking, leeftijd, DRG, DRG-beschrijving, $ vergoeding, AMLOS, GMLOS, risico op sterfte, ernst van ziekte, tandbaars, ziekenhuispostcode, enz.
- Medische dossiers uit verschillende Amerikaanse staten en regio's - Noordoost (46%), Zuid (9%), Midwest (3%), West (28%), Overige (14%)
- Medische dossiers die behoren tot alle gedekte patiëntklassen - intramuraal, poliklinisch (klinisch, revalidatie, terugkerende, chirurgische dagopvang), noodgevallen.
- Medische dossiers behorend tot alle leeftijdsgroepen van patiënten <10 jaar (7.9%), 11-20 jaar (5.7%), 21-30 jaar (10.9%), 31-40 jaar (11.7%), 41-50 jaar (10.4%) ), 51-60 jaar (13.8%), 61-70 jaar (16.1%), 71-80 jaar (13.3%), 81-90 jaar (7.8%), 90+ jaar (2.4%)
- Patiënt Geslachtsratio van 46% (mannelijk) en 54% (vrouwelijk)
- PII geredigeerde documenten die voldoen aan de Safe Harbor-richtlijnen in overeenstemming met HIPAA
Vijf redenen waarom kopers licentie Shaip in plaats van het aan elkaar te naaien.
De Shaip Medical Data Catalog bestaat omdat De meeste AI-teams in de gezondheidszorg verliezen negen tot twaalf maanden. Het verzamelen van conforme trainingsgegevens voordat er ook maar één model wordt getraind. Dit is wat er verandert wanneer die maanden worden geretourneerd.
Een catalogusomvang die de meeste teams niet kunnen evenaren.
De Shaip-catalogus omvat 257,977 uur van artsdictaten, transcripties van 31 medische specialismenen elektronische patiëntendossiers voor alle leeftijdsgroepen van patiënten — een volume dat kopers in staat stelt om Modellen trainen en evalueren zonder een tiental open datasets aan elkaar te koppelen..
Naleving is een beginvoorwaarde, geen doel op zich.
Elke medische dataset van Shaip wordt geleverd met HIPAA Safe Harbor-anonimisering standaardDeskundige beoordeling op verzoek, GDPR-conforme afhandeling en BAA-gereedheid voor betrokken entiteiten. Kopers hoeven de naleving niet achteraf te regelen.
Gespecialiseerde zorgprofessionals, geen doorsnee crowdworkers.
Annotatie, transcriptie en kwaliteitscontrole van de medische catalogus van Shaip worden uitgevoerd door in de gezondheidszorg opgeleide specialistenDe Shaip-workflow omvat meerlaagse kwaliteitscontrole en validatie met menselijke tussenkomst, afgestemd op klinische nauwkeurigheidsnormen.
Vandaag direct leverbaar, op aanvraag op maat.
Kopers kunnen bestaande Shaip-datasets direct in licentie nemen of een aangepaste verzameling laten samenstellen, afgestemd op specifieke demografische gegevens, geografische gebieden, talen en modaliteiten. zonder van leverancier te wisselen of de nalevingscontrole opnieuw uit te voeren..
Beschikbaar op de plekken waar datateams al werken.
De geanonimiseerde datasets met elektronische patiëntendossiers en artsendictaten van Shaip zijn beschikbaar op de website. Databricks-marktplaatsDe data wordt geleverd in formaten die data- en ML-teams al gebruiken: JSON, CSV en WAV. Voorbeelddatasets zijn beschikbaar voordat u een definitieve beslissing neemt.
Beveiliging en naleving
Kunt u niet vinden wat u zoekt?
Er worden nieuwe kant-en-klare medische datasets verzameld voor alle datatypes
Neem nu contact met ons op om uw zorgen over het verzamelen van gegevens over gezondheidstrainingen los te laten
Veel gestelde vragen (FAQ)
1. Wat zijn medische datasets?
Medische datasets zijn gegevens uit de gezondheidszorg die worden gebruikt om AI/ML-modellen te trainen, te evalueren en te verbeteren. Ze kunnen bestaan uit audio-opnamen van artsendictaten, getranscribeerde medische dossiers, elektronische patiëntendossiers, gesynthetiseerde dialogen tussen arts en patiënt, en multimodale datasets uit de gezondheidszorg die relevante tekst, spraak en gestructureerde klinische gegevens combineren.
2. Wat is opgenomen in de Shaip Medical Data Catalog?
De Shaip Medical Data Catalog bevat audio-opnamen van artsendictaten, getranscribeerde medische dossiers, elektronische patiëntendossiers, gesimuleerde arts-patiëntdialogen en multimodale datasets die tekst, spraak en gestructureerde klinische gegevens koppelen op patiënt- of consultniveau. De catalogus omvat 257,977 uur aan audio-opnamen van artsendictaten uit 31 medische specialismen en is beschikbaar voor commerciële AI-training.
3. Voldoen de medische datasets van Shaip aan de HIPAA-regelgeving?
Ja. De medische datasets van Shaip zijn standaard geanonimiseerd onder de HIPAA Safe Harbor-regeling, waarbij de 18 categorieën identificatoren die in de HIPAA Privacy Rule zijn gespecificeerd, worden verwijderd. De-identificatie op basis van een deskundige verklaring is ook beschikbaar wanneer statistische certificering vereist is, en Shaip is klaar voor BAA-overeenkomsten met gedekte entiteiten.
4. Voldoen de medische datasets van Shaip aan de AVG en andere vereisten voor gegevensbescherming in de gezondheidszorg?
Ja. De medische datasets van Shaip kunnen worden voorbereid om te voldoen aan de HIPAA-, GDPR- en andere toepasselijke vereisten voor gegevensbescherming in de gezondheidszorg, afhankelijk van de projectomvang, de geografische locatie, het gegevenstype en de contractuele vereisten.
5. Kan ik kant-en-klare datasets met zorggegevens kopen, of moeten die zelf verzameld worden?
Beide opties zijn beschikbaar. Shaip biedt kant-en-klare datasets met zorggegevens aan via de Shaip Medical Data Catalog voor commerciële AI-training. Als een project specifieke taal, demografische gegevens, specialismen, modaliteiten of klinische setting vereist, kan Shaip ook aangepaste medische dataverzameling uitvoeren volgens dezelfde kwaliteitsnormen.
6. Kunnen de medische datasets van Shaip worden aangepast?
Ja. Shaip kan medische datasets aanpassen op basis van specialisme, leeftijdsgroep van de patiënt, geslacht, geografische locatie, taal, modaliteit, klinische setting, formaat, volume en projectvereisten. Aangepaste datasets worden gedefinieerd in een werkomschrijving en voldoen aan de geldende anonimiserings- en compliance-normen.
7. Kan ik een voorbeeldgegevensset inzien voordat ik een licentie aanschaf?
Ja. Shaip levert representatieve voorbeeldgegevens onder een geheimhoudingsverklaring (NDA), zodat AI-teams het formaat, de kwaliteit, de demografische dekking en de geschiktheid van het model kunnen evalueren voordat ze een licentie afsluiten. Toegang tot voorbeeldgegevens is doorgaans de eerste stap vóór een standaardlicentie of een overeenkomst voor een aangepaste dataset.
8. In welke formaten levert Shaip medische datasets aan?
Shaip levert medische datasets in AI-compatibele formaten, waaronder JSON, CSV en FHIR voor gestructureerde gegevens; WAV-bestanden met bijbehorende transcripten voor audio; en transcriptbestanden voor spraak- en taaldatasets. Multimodale datasets kunnen manifestbestanden bevatten die tekst, audio en gestructureerde klinische gegevens koppelen.
9. Hoe waarborgt Shaip de kwaliteit van medische datasets?
Shaip waarborgt de kwaliteit van medische datasets door middel van beoordeling door experts, annotatie door domeinspecialisten, validatieworkflows en gestructureerde kwaliteitscontroles. Deze processen dragen bij aan de nauwkeurigheid, betrouwbaarheid en geschiktheid van modellen voor de ontwikkeling van AI in de gezondheidszorg.
10. Zijn de medische datasets van Shaip schaalbaar voor grote AI/ML-projecten?
Ja. De medische datasets van Shaip zijn schaalbaar voor zowel kleine pilotprojecten als grote AI/ML-projecten. Ze kunnen projecten ondersteunen die grote hoeveelheden medische dossiers, gestructureerde klinische gegevens, transcripten of honderdduizenden uren aan audio-opnames van artsen vereisen.
11. Kunnen medische datasets van Shaip worden geïntegreerd in bestaande AI-modellen en -workflows?
Ja. Shaip levert medische datasets in gebruiksklare formaten zoals JSON, CSV, FHIR, WAV en transcriptbestanden. Deze formaten ondersteunen integratie in bestaande workflows voor AI, ML, NLP, spraakherkenning, LLM in de gezondheidszorg en multimodale modelontwikkeling.
12. Hoe lang duurt het voordat ik een Shaip-medische dataset ontvang?
Standaard medische datasets kunnen doorgaans binnen enkele dagen na beoordeling van de monsters, contractondertekening en afronding van de licentieverlening worden geleverd. De tijdlijn voor het verzamelen van aangepaste datasets is afhankelijk van de projectomvang, de grootte van de dataset, de modaliteit, de nalevingsvereisten en de complexiteit, en wordt vastgelegd in de projectomschrijving.
13. Hoeveel kosten medische datasets?
De kosten van medische datasets zijn afhankelijk van het type dataset, de modaliteit, het volume, de aanpassingsvereisten, de licentievoorwaarden, de levertijd en de nalevingseisen. Teams kunnen hun wensen via het contactformulier doorgeven om een offerte op maat te ontvangen.
14. Waarom zijn medische datasets belangrijk voor AI/ML in de gezondheidszorg?
Hoogwaardige medische datasets zijn essentieel voor het trainen van accurate, betrouwbare en klinisch bruikbare AI-modellen in de gezondheidszorg. Ze dragen bij aan de verbetering van medische documentatie, klinische NLP, spraakherkenning, samenvatting, besluitvormingsondersteuning, automatisering, patiëntenzorgprocessen en data-analyse in de gezondheidszorg.