Ensembles de données de dossiers médicaux électroniques (DME) anonymisés pour les projets d'IA et d'apprentissage automatique
Données de dossiers médicaux électroniques sous licence commerciale et conformes à la loi HIPAA — prêtes pour l'IA clinique, le NLP et la modélisation prédictive.
Que sont les données des dossiers médicaux électroniques et pourquoi sont-elles importantes pour l'IA ?
Les dossiers de santé électroniques (DSE) sont des dossiers numériques longitudinaux, tenus à jour par les professionnels de santé tout au long du parcours de soins : hôpitaux, cliniques externes, cabinets de spécialistes et laboratoires. Contrairement aux dossiers médicaux électroniques (DME), qui ne sont que des instantanés liés à un seul professionnel de santé, les données des DSE couvrent l’intégralité du parcours du patient et enregistrent les interactions dans différents contextes de soins.
Le catalogue de données EHR anonymisées de Shaip couvre les deux, offrant à votre équipe une source unique et conforme aux normes pour l'ensemble du développement de l'IA dans le domaine de la santé.
Les ensembles de données EHR contiennent deux types de données essentiels pour le développement de l'IA : données structurées (données démographiques, codes de diagnostic CIM-10, codes GHM, listes de médicaments, valeurs de laboratoire, signes vitaux) et données non structurées (Notes cliniques, résumés de sortie, rapports de radiologie, dictées médicales). Environ 80 % des informations des dossiers médicaux électroniques sont non structurées, ce qui en fait la principale source d'entraînement des modèles de traitement automatique du langage naturel clinique.
Trouvez les bonnes données de dossiers de santé électroniques (DSE) pour votre santé AI
Améliorez vos modèles d'apprentissage automatique avec les meilleures données de formation. Shaip propose des ensembles de données de dossiers médicaux électroniques (DME) anonymisés et disponibles dans le commerce, conçus spécifiquement pour les équipes d'IA et d'apprentissage automatique. Notre catalogue de données DME prêtes à l'emploi fournit des dossiers patients structurés et prêts pour la recherche dans plus de 20 spécialités médicales — incluant les diagnostics, les ordonnances, les résultats de laboratoire, les comptes rendus de radiologie, l'historique de vaccination et les notes cliniques — le tout étant entièrement anonymisé conformément aux normes HIPAA Safe Harbor et RGPD.
Que vous développiez des systèmes d'aide à la décision clinique, entraîniez des modèles de traitement automatique du langage naturel (TALN) sur des notes médicales, créiez des algorithmes de prédiction des maladies ou alimentiez des outils d'automatisation des soins de santé, les ensembles de données de dossiers médicaux électroniques (DME) de Shaip vous offrent la profondeur, la diversité et la garantie de conformité requises par votre projet d'IA. Licence immédiate, sélection de cohorte personnalisée ou téléchargement d'un échantillon disponibles.
Dossiers de santé électroniques (DSE) prêts à l'emploi :
- Plus de 5.1 millions de dossiers et de fichiers audio de médecins dans 31 spécialités
- Dossiers médicaux de référence dans le monde réel pour former la PNL clinique et d'autres modèles d'IA de document
- Informations sur les métadonnées telles que MRN (anonymisé), date d'admission, date de sortie, durée du séjour, sexe, catégorie de patients, payeur, catégorie financière, état, état de sortie, âge, DRG, description du DRG, remboursement en dollars, AMLOS, GMLOS, risque de mortalité, gravité de la maladie, mérou, code postal de l'hôpital, etc.
- Dossiers médicaux de divers États et régions des États-Unis - Nord-Est (46 %), Sud (9 %), Midwest (3 %), Ouest (28 %), Autres (14 %)
- Dossiers médicaux appartenant à toutes les catégories de patients couvertes - patients hospitalisés, patients externes (cliniques, de réadaptation, récurrents, soins de jour chirurgicaux), urgences.
- Dossiers médicaux appartenant à tous les groupes d'âge des patients <10 ans (7.9 %), 11-20 ans (5.7 %), 21-30 ans (10.9 %), 31-40 ans (11.7 %), 41-50 ans (10.4 % ), 51-60 ans (13.8%), 61-70 ans (16.1%), 71-80 ans (13.3%), 81-90 ans (7.8%), 90+ ans (2.4%)
- Rapport entre les sexes des patients de 46 % (homme) et 54 % (femme)
- PII Documents expurgés adhérant aux directives de la sphère de sécurité conformément à la loi HIPAA
| Lieu | Documents texte |
|---|---|
| Nord-est | 4,473,573 |
| Région Sud | 1,801,716 |
| Mid-Ouest | 781,701 |
| Ouest | 1,509,109 |
| Catégorie de diagnostic principal | Documents texte |
|---|---|
| Consommation d'alcool/de drogues et troubles mentaux organiques induits par l'alcool/les drogues | 48,717 |
| Total tout compris (Cas avec et sans catégorie MDC) | 8,566,687 |
| Cas sans remboursement générés (MDC non précisé) | 790,697 |
| Cas ambulatoires (MDC non spécifié) | 1,980,606 |
| Cas utilisant un groupeur spécialisé tel que 3M (MDC non spécifié) | 1,619,682 |
| Total avec MDC | 4,175,702 |
| Consommation d'alcool/drogues ou troubles mentaux induits | 48,717 |
| Brûlures | 444 |
| Œil | 3,549 |
| Système reproductif masculin | 9,230 |
| Infections par le virus de l'immunodéficience humaine | 12,422 |
| Maladies et troubles myéloprolifératifs, néoplasmes mal différenciés | 15,620 |
| Facteurs influençant l'état de santé et autres contacts avec les services de santé | 21,294 |
| Le système de reproduction féminin | 17,010 |
| Oreille, nez, bouche et gorge | 22,987 |
| Traumatismes importants multiples | 27,902 |
| Système circulatoire | 589,730 |
| Sang, organes hématopoïétiques et maladies immunologiques | 48,990 |
| Blessures, empoisonnements et effets toxiques des drogues | 64,097 |
| Peau, tissu sous-cutané et sein | 89,577 |
| Système hépatobiliaire et pancréas | 127,172 |
| Maladies et troubles endocriniens, nutritionnels et métaboliques | 142,808 |
| Nouveau-nés et autres nouveau-nés atteints d'affections originaires de la période périnatale | 163,605 |
| Grossesse, accouchement et puerpéralité | 165,303 |
| Reins et voies urinaires | 209,561 |
| Maladies et troubles mentaux | 282,501 |
| Système nerveux | 316,243 |
| Système digestif | 346,369 |
| Système musculo-squelettique et tissu conjonctif | 329,344 |
| Système respiratoire | 561,983 |
| Maladies infectieuses et parasitaires | 559,244 |
Nous traitons tous les types de licences de données, c'est-à-dire le texte, l'audio, la vidéo ou l'image. Les ensembles de données se composent d'ensembles de données médicales pour ML : ensemble de données de dictée de médecins, notes cliniques de médecins, ensemble de données de conversation médicale, ensemble de données de transcription médicale, conversation médecin-patient, données de texte médical, images médicales - tomodensitométrie, IRM, ultrasons (exigences personnalisées de base collectées) .
Applications concrètes des ensembles de données DSE en IA/ML
- Prédiction et diagnostic des maladies:Former des modèles d’IA pour prédire des maladies telles que le diabète, le cancer et les maladies cardiovasculaires.
- Aide à la décision cliniqueFormer des modèles pour faire émerger des recommandations de diagnostic, signaler les interactions médicamenteuses et faciliter la planification du traitement à l'aide de données structurées du dossier médical électronique.
- Médecine personnalisée:Utilisez les données démographiques et diagnostiques pour recommander des plans de traitement personnalisés.
- Automatisation des soins de santé:Automatisez les tâches administratives telles que la planification des rendez-vous ou la facturation avec des outils basés sur la PNL et formés sur des ensembles de données EHR.
Modélisation prédictive des soins de santé — Élaborer des modèles de stratification des risques et de prédiction des maladies à partir de dossiers patients longitudinaux, de codes DRG et de scores de gravité de la maladie.
Études de données probantes du monde réel (RWE) — Générer des données probantes post-commercialisation et des informations en matière de pharmacovigilance en analysant les données de résultats des dossiers médicaux électroniques à travers des cohortes de patients.
Traitement automatique du langage naturel pour les notes cliniques — Extraire les entités, les affections et les procédures des notes médicales non structurées et des résumés de sortie à l'aide de données d'entraînement EHR annotées.
Pourquoi choisir Shaip pour les ensembles de données EHR ?
Effectif expert
Des professionnels qualifiés garantissent une annotation des données précise et de haute qualité.
Conformité réglementaire
Ensembles de données entièrement anonymisés conformes aux normes HIPAA et GDPR.
Une tarification compétitive
Des solutions rentables livrées sans compromettre la qualité.
Données sans biais
Des protocoles stricts éliminent les biais, garantissant des résultats d’IA fiables.
Rapide et précis
Des processus rationalisés garantissent une livraison rapide de données diversifiées et de haute qualité.
Disponibilité et livraison
Disponibilité élevée du réseau et livraison ponctuelle des données, services et solutions.
Éprouvé à grande échelle
Utilisée par Google et les principales entreprises d'IA en santé. Qualité contrôlée par les processus Six Sigma Black Belt et revue par des experts médicaux.
Prêt à être commercialisé
Le catalogue de dossiers médicaux électroniques (DME) prêts à l'emploi de Shaip est sous licence, anonymisé et prêt à être téléchargé ou consulté dès aujourd'hui via la plateforme Databricks Marketplace.
Assistance tout au long du cycle de vie
Besoin d'annotations sur des données brutes ? Shaip propose la dépersonnalisation, l'étiquetage NER clinique et l'augmentation des données, le tout auprès d'un partenaire unique.
Vous n'arrivez pas à trouver ce que vous cherchez?
De nouveaux ensembles de données médicales prêts à l'emploi sont collectés dans tous les types de données
Contactez-nous dès maintenant pour vous débarrasser de vos soucis de collecte de données de formation en soins de santé
Questions fréquentes
1. À quoi servent les ensembles de données DSE dans l’IA ?
Les ensembles de données EHR sont utilisés pour former des modèles d’IA pour la prédiction des maladies, la prise de décision clinique et les traitements personnalisés.
2. Comment les données du DSE sont-elles utilisées dans les projets d’IA/ML ?
Les données du DSE sont utilisées pour former des modèles d’IA pour l’aide à la décision clinique, la prédiction des maladies, la planification personnalisée des traitements et l’automatisation des soins de santé.
3. Les données du DSE sont-elles anonymisées ?
Oui, toutes les données du DSE sont anonymisées afin de supprimer les informations personnelles identifiables (PII) et de se conformer aux réglementations en matière de confidentialité.
4. Quels sont les éléments clés des données du DSE ?
Les données du DSE contiennent des détails tels que les données démographiques des patients, les antécédents médicaux, les diagnostics, les plans de traitement, les résultats des tests de laboratoire, les images radiologiques (par exemple, TDM, IRM, radiographies), les ordonnances et les dossiers de vaccination.
5. Les données sont-elles conformes à la loi HIPAA et à d’autres réglementations ?
Oui, les données sont conformes aux normes HIPAA, GDPR et autres normes mondiales de confidentialité pour garantir une utilisation sécurisée et éthique.
6. Les ensembles de données EHR peuvent-ils être personnalisés ?
Oui, les ensembles de données peuvent être personnalisés en fonction de spécialités médicales spécifiques, de régions, de données démographiques des patients ou des exigences du projet.
7. Les données peuvent-elles s’intégrer dans mes modèles d’IA ?
Oui, les ensembles de données sont fournis dans des formats standard (par exemple, JSON, CSV) pour une intégration facile dans les flux de travail d'IA et de ML.
8. Comment la qualité des données est-elle assurée ?
Les données sont soumises à des contrôles rigoureux de validation et de qualité pour garantir leur exactitude, leur cohérence et leur fiabilité.
9. Quel est le coût des ensembles de données du DSE ?
Les coûts dépendent de facteurs tels que le volume de données, la personnalisation et la portée du projet. Pour obtenir le meilleur devis, veuillez remplir le formulaire « Contactez-nous ».
10. Quels sont les délais de livraison des ensembles de données du DSE ?
Les délais de livraison varient en fonction de la taille et de la complexité du projet, mais sont conçus pour respecter les délais convenus.
11. Comment les ensembles de données EHR peuvent-ils améliorer les solutions d’IA dans le domaine de la santé ?
Les ensembles de données EHR permettent aux systèmes d’IA de fournir de meilleurs diagnostics, des informations prédictives et un traitement personnalisé, améliorant ainsi les résultats des patients et l’efficacité des soins de santé.
12. Puis-je obtenir des ensembles de données EHR personnalisés ?
Oui, Shaip propose des ensembles de données EHR personnalisés en fonction de la spécialité, du groupe d'âge, de la géographie ou des exigences du projet.
13. Quelle est la différence entre un ensemble de données EHR et un ensemble de données EMR ?
Les dossiers médicaux électroniques (DME) contiennent des données cliniques provenant d'un seul professionnel de santé ; les dossiers de santé électroniques (DSE) couvrent l'intégralité du parcours de soins, impliquant plusieurs professionnels, établissements et périodes. Shaip propose des ensembles de données DSE et DME, avec des dossiers longitudinaux multiprofessionnels disponibles pour répondre aux exigences complexes d'entraînement de l'IA.
14. Comment les données du dossier médical électronique sont-elles dépersonnalisées ?
Tous les dossiers sont anonymisés conformément à la méthode Safe Harbor de la règle de confidentialité HIPAA, qui supprime les 18 identifiants de données de santé protégées (DSP), notamment le nom, la date de naissance, l'adresse et les numéros de dossier médical. Le champ MRN anonymisé est conservé pour le couplage des dossiers au sein de l'ensemble de données, permettant ainsi une analyse longitudinale sans risque de réidentification.