Catalogue de données médicales pour l'IA dans le secteur de la santé

Ensembles de données médicales/médicales prêts à l'emploi pour démarrer votre projet d'IA médicale

Catalogue de données médicales

Ensembles de données médicales et de santé pour l'apprentissage automatique

Que contient le catalogue de données médicales Shaip ?

Le catalogue de données médicales Shaip est une bibliothèque prête à l'emploi, conforme à la loi HIPAA, de données de formation médicales anonymisées couvrant 31 spécialités médicales. Il comprend 257 977 heures d'enregistrements audio de dictées médicales, des dossiers médicaux transcrits, des dossiers de santé électroniques et des ensembles de données multimodaux. Chaque ensemble de données est autorisé pour la formation commerciale en IA et est livré avec une dépersonnalisation de type Safe Harbor ou Expert Determination.

Données audio de la dictée du médecin

Notre ensemble de données anonymisées pour les soins de santé comprend des fichiers audio de 31 spécialités dictés par des médecins décrivant l'état clinique et le plan de soins des patients en fonction des rencontres médecin-patient en milieu clinique.

Fichiers audio de dictée médicale prêts à l'emploi :

  • 257,977 31 heures de données de dictées vocales de médecins du monde réel provenant de XNUMX spécialités pour former des modèles de discours dans le domaine de la santé
  • Audio de dictée capturé à partir de divers appareils tels que la dictée téléphonique (54.3 %), l'enregistreur numérique (24.9 %), le micro vocal (5.4 %), le téléphone intelligent (2.7 %) et l'inconnu (12.7 %)
  • PII Redacted Audio & Transcripts adhérant aux directives Safe Harbor conformément à la loi HIPAA
Données audio de dictée médicale

Dossiers médicaux transcrits

La transcription des dossiers médicaux comprend la transcription des conversations entre le médecin et le patient, des rapports médicaux et des évaluations médicales. Elle permet de cartographier l'historique médical du patient pour les consultations ultérieures et sert également de référence aux médecins. Elle permet d'évaluer l'état actuel du patient et de proposer un traitement adapté.

Dossiers médicaux transcrits prêts à l'emploi :

  • Transcription de 257,977 31 heures de dictée médicale du monde réel de XNUMX spécialités pour former des modèles de discours de santé
  • Dossiers médicaux transcrits de divers types de travail comme le rapport opératoire, le résumé de sortie, la note de consultation, la note d'admission, la note ED, la note clinique, le rapport de radiologie, etc.
  • PII Redacted Audio & Transcripts adhérant aux directives Safe Harbor conformément à la loi HIPAA
Dossiers médicaux transcrits

Dossiers de santé électroniques (DSE)

Les dossiers de santé électroniques ou EHR sont des dossiers médicaux contenant les antécédents médicaux, les diagnostics, les ordonnances, les plans de traitement, les dates de vaccination ou d'immunisation, les allergies, les images radiologiques (CT Scan, IRM, rayons X) et les tests de laboratoire du patient, etc.

Dossiers de santé électroniques (DSE) prêts à l'emploi :

  • Plus de 5.1 millions de dossiers et de fichiers audio de médecins dans 31 spécialités
  • Dossiers médicaux de référence dans le monde réel pour former la PNL clinique et d'autres modèles d'IA de document
  • Informations sur les métadonnées telles que MRN (anonymisé), date d'admission, date de sortie, durée du séjour, sexe, catégorie de patients, payeur, catégorie financière, état, état de sortie, âge, DRG, description du DRG, remboursement en dollars, AMLOS, GMLOS, risque de mortalité, gravité de la maladie, mérou, code postal de l'hôpital, etc.
  • Dossiers médicaux de divers États et régions des États-Unis - Nord-Est (46 %), Sud (9 %), Midwest (3 %), Ouest (28 %), Autres (14 %)
  • Dossiers médicaux appartenant à toutes les catégories de patients couvertes - patients hospitalisés, patients externes (cliniques, de réadaptation, récurrents, soins de jour chirurgicaux), urgences.
Dossiers de santé électroniques (DSE)
  • Dossiers médicaux appartenant à tous les groupes d'âge des patients <10 ans (7.9 %), 11-20 ans (5.7 %), 21-30 ans (10.9 %), 31-40 ans (11.7 %), 41-50 ans (10.4 % ), 51-60 ans (13.8%), 61-70 ans (16.1%), 71-80 ans (13.3%), 81-90 ans (7.8%), 90+ ans (2.4%)
  • Rapport entre les sexes des patients de 46 % (homme) et 54 % (femme)
  • PII Documents expurgés adhérant aux directives de la sphère de sécurité conformément à la loi HIPAA

Cinq raisons pour lesquelles les acheteurs licence Shaip au lieu de le coudre ensemble.

Le catalogue de données médicales Shaip existe parce que La plupart des équipes d'IA dans le secteur de la santé perdent entre neuf et douze mois. L'approvisionnement en données d'entraînement conformes est nécessaire avant même l'entraînement du premier modèle. Voici ce qui change lorsque ces données mensuelles sont récupérées.

01

L'envergure du catalogue est inégalée par la plupart des équipes.

Le catalogue Shaip couvre de 257,977 heures transcriptions de dictées de médecins 31 spécialités médicaleset les dossiers médicaux électroniques couvrant toutes les tranches d'âge des patients — le type de volume qui permet aux acheteurs Entraînez et évaluez des modèles sans avoir à assembler une douzaine d'ensembles de données ouverts..

02

La conformité est une condition de départ, pas une caractéristique.

Chaque ensemble de données médicales Shaip est livré avec Dépersonnalisation par défaut conforme à la loi HIPAA Safe HarborDétermination d'expert sur demande, traitement conforme au RGPD et préparation aux accords de partenariat commercial (BAA) pour les entités concernées. Les acheteurs n'ont pas besoin de se conformer a posteriori.

Port de sécurité HIPAA Détermination d'expert Conforme au RGPD Prêt pour le BAA
03

Des spécialistes formés dans le domaine de la santé, et non des travailleurs de masse génériques.

L'annotation, la transcription et l'assurance qualité du catalogue médical Shaip sont réalisées par spécialistes formés dans le domaine de la santéLe flux de travail de Shaip comprend une assurance qualité multicouche et une validation avec intervention humaine, calibrées selon des normes de précision clinique.

04

Disponibles en stock aujourd'hui, sur mesure à la demande.

Les acheteurs peuvent obtenir immédiatement une licence pour les ensembles de données Shaip existants ou commander une collection personnalisée adaptée à des données démographiques, géographiques, linguistiques et modalités spécifiques. sans changer de fournisseur ni relancer l'audit de conformité.

05

Disponible là où les équipes de données sont déjà présentes.

Les ensembles de données dépersonnalisées de Shaip, comprenant les dossiers médicaux électroniques et les dictées des médecins, sont disponibles sur le site web. Marché DatabricksLes données sont livrées dans des formats déjà utilisés par les équipes de données et d'apprentissage automatique : JSON, CSV et WAV. Des exemples de jeux de données sont disponibles avant tout engagement.

JSON CSV WAV HOMME

Sécurité et conformité

GDPR
HIPAA
ISO 9001: 2015
SOC2 Type II
ISO 27001
Shaip nous contacter

Vous n'arrivez pas à trouver ce que vous cherchez?

De nouveaux ensembles de données médicales prêts à l'emploi sont collectés dans tous les types de données 

Contactez-nous dès maintenant pour vous débarrasser de vos soucis de collecte de données de formation en soins de santé

  • Ce champ est à des fins de validation et devrait être laissé inchangé.
  • En m'inscrivant, je suis d'accord avec Shaip Politique de confidentialité et Conditions d’utilisation et donner mon consentement pour recevoir des communications marketing B2B de Shaip.

Les jeux de données médicaux sont des données de santé utilisées pour entraîner, évaluer et améliorer les modèles d'IA/ML. Ils peuvent inclure des enregistrements audio de dictées de médecins, des dossiers médicaux transcrits, des dossiers de santé électroniques, des dialogues synthétiques médecin-patient et des jeux de données de santé multimodaux combinant texte, parole et données cliniques structurées pertinentes.

Le catalogue de données médicales Shaip comprend des enregistrements audio de dictées médicales, des dossiers médicaux transcrits, des dossiers de santé électroniques, des dialogues synthétiques médecin-patient et des ensembles de données multimodales reliant texte, parole et données cliniques structurées au niveau du patient ou de la consultation. Il contient 257 977 heures d'enregistrements audio de dictées médicales couvrant 31 spécialités et est disponible pour l'entraînement de l'IA commerciale.

Oui. Les ensembles de données médicales de Shaip sont anonymisés par défaut conformément à la sphère de sécurité HIPAA, ce qui supprime les 18 catégories d'identifiants spécifiées dans la règle de confidentialité HIPAA. L'anonymisation par expertise est également possible lorsqu'une certification statistique est requise, et Shaip est prêt pour les accords de partenariat commercial (BAA) pour les entités concernées.

Oui. Les ensembles de données médicales de Shaip peuvent être préparés pour répondre aux exigences HIPAA, RGPD et autres exigences applicables en matière de données de santé, en fonction de la portée du projet, de la zone géographique, du type de données et des exigences contractuelles.

Les deux options sont disponibles. Shaip propose des jeux de données de santé prêts à l'emploi via son catalogue de données médicales pour l'entraînement de l'IA commerciale. Si un projet requiert une langue, des données démographiques, une spécialité, une modalité ou un contexte clinique spécifiques, Shaip peut également réaliser une collecte de données médicales personnalisée, dans le respect des mêmes normes de conformité.

Oui. Shaip peut personnaliser les ensembles de données médicales selon la spécialité, la tranche d'âge du patient, le sexe, la zone géographique, la langue, la modalité, le contexte clinique, le format, le volume et les exigences du projet. Les ensembles de données personnalisés sont définis dans un cahier des charges et respectent les normes applicables en matière d'anonymisation et de conformité.

Oui. Shaip fournit des exemples de jeux de données sous accord de confidentialité afin que les équipes d'IA puissent évaluer le format, la qualité, la couverture démographique et l'adéquation du modèle avant l'acquisition d'une licence. L'accès à ces exemples est généralement la première étape avant de souscrire une licence standard ou de créer une collection personnalisée.

Shaip fournit des ensembles de données médicales dans des formats compatibles avec l'IA, notamment JSON, CSV et FHIR pour les dossiers structurés ; des fichiers WAV avec transcriptions associées pour l'audio ; et des fichiers de transcription pour les données vocales et linguistiques. Les ensembles de données multimodaux peuvent inclure des fichiers manifestes reliant le texte, l'audio et les dossiers cliniques structurés.

Shaip garantit la qualité des ensembles de données médicales grâce à une évaluation par des experts, des annotations réalisées par des spécialistes du domaine, des processus de validation et des contrôles qualité structurés. Ces processus contribuent à assurer l'exactitude, la fiabilité et la disponibilité des modèles pour le développement de l'IA dans le domaine de la santé.

Oui. Les ensembles de données médicales de Shaip sont évolutifs et conviennent aussi bien aux petits projets pilotes qu'aux projets d'IA/ML d'entreprise. Ils peuvent prendre en charge des projets nécessitant de grands volumes de dossiers médicaux, de données cliniques structurées, de transcriptions ou des centaines de milliers d'heures d'enregistrements audio de dictées médicales.

Oui. Shaip fournit des ensembles de données médicales dans des formats prêts à l'emploi tels que JSON, CSV, FHIR, WAV et des fichiers de transcription. Ces formats facilitent l'intégration dans les flux de travail existants de développement de modèles d'IA, d'apprentissage automatique, de traitement automatique du langage naturel, de parole, de modélisation des langages de santé et de modèles multimodaux.

Les ensembles de données médicales prêts à l'emploi peuvent généralement être livrés quelques jours après l'examen des échantillons, la signature du contrat et la finalisation des licences. Les délais de collecte personnalisés dépendent de la portée du projet, de la taille de l'ensemble de données, de la modalité, des exigences de conformité et de la complexité, et sont définis dans le cahier des charges.

Le coût des ensembles de données médicales dépend de leur type, de leur modalité, de leur volume, des exigences de personnalisation, des conditions de licence, du délai de livraison et des exigences de conformité. Les équipes peuvent nous faire part de leurs besoins via le formulaire de contact afin d'obtenir un devis personnalisé.

Des ensembles de données médicales de haute qualité sont essentiels pour former des modèles d'IA de santé précis, fiables et cliniquement utiles. Ils contribuent à améliorer la documentation médicale, le traitement automatique du langage naturel clinique, la reconnaissance vocale, la synthèse vocale, l'aide à la décision, l'automatisation, les flux de travail de soins aux patients et l'analyse des données de santé.