Catálogo de datos médicos para la IA en el sector sanitario
Conjuntos de datos médicos/sanitarios listos para usar para impulsar su proyecto de IA para el cuidado de la salud
Conjuntos de datos médicos y sanitarios para el aprendizaje automático
¿Qué incluye el catálogo de datos médicos de Shaip?
El catálogo de datos médicos de Shaip es una biblioteca de datos de entrenamiento sanitario anonimizados, compatible con HIPAA y lista para usar, que abarca 31 especialidades médicas. Incluye 257 977 horas de audio de dictados médicos, transcripciones de historiales médicos, registros electrónicos de salud y conjuntos de datos multimodales. Cada conjunto de datos cuenta con licencia para entrenamiento comercial de IA y se distribuye con anonimización según los estándares de Safe Harbor o Determinación de Expertos.
Datos de audio del dictado médico
Nuestro conjunto de datos anónimos para el cuidado de la salud incluye archivos de audio de 31 especialidades dictados por médicos que describen la condición clínica de los pacientes y el plan de atención basado en encuentros médico-paciente en el entorno clínico.
Archivos de audio de dictados médicos listos para usar:
- 257,977 horas de datos de dictado de médicos del mundo real de 31 especialidades para entrenar modelos de habla en el sector sanitario.
- Audio de dictado capturado desde varios dispositivos como Dictado telefónico (54.3 %), Grabadora digital (24.9 %), Micrófono de voz (5.4 %), Teléfono inteligente (2.7 %) y Desconocido (12.7 %)
- Audio y transcripciones redactados de PII que se adhieren a las pautas de puerto seguro de conformidad con HIPAA
Expedientes médicos transcritos
La transcripción de historiales médicos se refiere a la transcripción de conversaciones entre médico y paciente, así como de informes médicos y evaluaciones médicas. Ayuda a recopilar el historial médico del paciente para futuras consultas y también sirve como punto de referencia para los médicos. Ayuda a evaluar el estado actual del paciente y a sugerir el tratamiento adecuado.
Expedientes médicos transcritos listos para usar:
- Transcripción de 257,977 31 horas de dictado médico del mundo real de XNUMX especialidades para entrenar modelos de habla de atención médica
- Registros médicos transcritos de varios tipos de trabajo, como informe operativo, resumen de alta, nota de consulta, nota de admisión, nota ED, nota clínica, informe de radiología, etc.
- Audio y transcripciones redactados de PII que se adhieren a las pautas de puerto seguro de conformidad con HIPAA
Registros electrónicos de salud (EHR)
Los registros médicos electrónicos o EHR son registros médicos que contienen el historial médico del paciente, diagnósticos, recetas, planes de tratamiento, fechas de vacunación o inmunización, alergias, imágenes de radiología (tomografía computarizada, resonancia magnética, rayos X) y pruebas de laboratorio y más.
Expedientes médicos electrónicos (EHR) listos para usar:
- Más de 5.1 millones de registros y archivos de audio de médicos en 31 especialidades
- Registros médicos estándar de oro del mundo real para entrenar NLP clínico y otros modelos de Document AI
- Información de metadatos como MRN (anonimizado), fecha de ingreso, fecha de alta, días de estadía, género, clase de paciente, pagador, clase financiera, estado, disposición de alta, edad, DRG, descripción de DRG, reembolso de $, AMLOS, GMLOS, riesgo de mortalidad, gravedad de la enfermedad, mero, código postal del hospital, etc.
- Registros médicos de varios estados y regiones de EE. UU.: noreste (46 %), sur (9 %), medio oeste (3 %), oeste (28 %), otros (14 %)
- Expedientes médicos pertenecientes a todas las clases de pacientes cubiertas: pacientes hospitalizados, pacientes ambulatorios (clínicos, de rehabilitación, recurrentes, de día quirúrgicos), de emergencia.
- Registros médicos pertenecientes a todos los grupos de edad de pacientes <10 años (7.9 %), 11-20 años (5.7 %), 21-30 años (10.9 %), 31-40 años (11.7 %), 41-50 años (10.4 %) ), 51-60 años (13.8 %), 61-70 años (16.1 %), 71-80 años (13.3 %), 81-90 años (7.8 %), 90+ años (2.4 %)
- Proporción de género del paciente de 46% (hombre) y 54% (mujer)
- Documentos redactados de PII que se adhieren a las pautas de puerto seguro de conformidad con HIPAA
Cinco razones por las que los compradores licencia Shaip en lugar de coserlo.
El catálogo de datos médicos de Shaip existe porque La mayoría de los equipos de IA en el sector sanitario pierden entre nueve y doce meses. Obtener datos de entrenamiento que cumplan con los requisitos antes de entrenar un solo modelo. Esto es lo que cambia cuando se recuperan esos meses.
La magnitud de nuestro catálogo es inalcanzable para la mayoría de los equipos.
El catálogo de Shaip abarca 257,977 horas dictado médico, transcripciones de Especialidades médicas 31y registros de HCE que cubren todos los grupos de edad de los pacientes, el tipo de volumen que permite a los compradores Entrena y evalúa modelos sin tener que combinar una docena de conjuntos de datos abiertos..
El cumplimiento normativo es una condición inicial, no una característica.
Cada conjunto de datos médicos de Shaip se envía con Desidentificación por defecto según la norma HIPAA Safe HarborDeterminación experta a solicitud, gestión conforme al RGPD y preparación para el BAA para las entidades cubiertas. Los compradores no necesitan realizar adaptaciones posteriores para cumplir con la normativa.
Especialistas con formación sanitaria, no trabajadores de masas genéricos.
La anotación, transcripción y control de calidad del catálogo médico de Shaip son realizadas por especialistas capacitados en atención médicaEl flujo de trabajo de Shaip incluye un control de calidad multicapa y una validación con intervención humana, calibrada según los estándares de precisión clínica.
Disponibles de inmediato, personalizados bajo pedido.
Los compradores pueden obtener licencias de los conjuntos de datos existentes de Shaip de inmediato o encargar una recopilación personalizada adaptada a datos demográficos, geográficos, idiomas y modalidades específicos. sin cambiar de proveedor ni volver a ejecutar la revisión de cumplimiento.
Disponible donde ya trabajan los equipos de datos.
Los conjuntos de datos de EHR y dictados médicos anonimizados de Shaip están disponibles en el Mercado de ladrillos de datosCon entrega en formatos que los equipos de datos y aprendizaje automático ya utilizan: JSON, CSV y WAV. Hay conjuntos de datos de muestra disponibles antes de cualquier compromiso.
Seguridad y cumplimiento
¿No encuentras lo que estás buscando?
Se recopilan nuevos conjuntos de datos médicos listos para usar en todos los tipos de datos
Contáctenos ahora para dejar de lado sus preocupaciones sobre la recopilación de datos de capacitación en atención médica
Preguntas frecuentes
1. ¿Qué son los conjuntos de datos médicos?
Los conjuntos de datos médicos son datos sanitarios que se utilizan para entrenar, evaluar y mejorar los modelos de IA/aprendizaje automático. Pueden incluir audios de dictados médicos, transcripciones de historiales médicos, registros electrónicos de salud, diálogos sintéticos entre médicos y pacientes, y conjuntos de datos sanitarios multimodales que combinan texto, voz y datos clínicos estructurados relevantes.
2. ¿Qué incluye el Catálogo de Datos Médicos de Shaip?
El catálogo de datos médicos de Shaip incluye grabaciones de audio de dictados médicos, transcripciones de historiales médicos, registros electrónicos de salud, diálogos sintéticos entre médicos y pacientes, y conjuntos de datos multimodales que vinculan texto, voz y datos clínicos estructurados a nivel de paciente o consulta. Contiene 257 977 horas de audio de dictados médicos en 31 especialidades médicas y está disponible para el entrenamiento comercial de IA.
3. ¿Los conjuntos de datos médicos de Shaip cumplen con la normativa HIPAA?
Sí. Los conjuntos de datos médicos de Shaip se anonimizan de forma predeterminada conforme a la cláusula de protección de HIPAA, eliminando las 18 categorías de identificadores especificadas en la Regla de Privacidad de HIPAA. También se ofrece la anonimización mediante determinación experta cuando se requiere certificación estadística, y Shaip cumple con los requisitos de BAA para las entidades cubiertas.
4. ¿Los conjuntos de datos médicos de Shaip cumplen con el RGPD y otros requisitos de datos sanitarios?
Sí. Los conjuntos de datos médicos de Shaip se pueden preparar para cumplir con HIPAA, GDPR y otros requisitos de datos sanitarios aplicables, según el alcance del proyecto, la ubicación geográfica, el tipo de datos y los requisitos contractuales.
5. ¿Puedo comprar conjuntos de datos sanitarios ya preparados o es necesario recopilarlos?
Ambas opciones están disponibles. Shaip ofrece conjuntos de datos sanitarios listos para usar a través del Catálogo de Datos Médicos de Shaip para el entrenamiento comercial de IA. Si un proyecto requiere un idioma, datos demográficos, especialidad, modalidad o entorno clínico específicos, Shaip también puede realizar la recopilación de datos médicos personalizados bajo los mismos estándares de cumplimiento.
6. ¿Se pueden personalizar los conjuntos de datos médicos de Shaip?
Sí. Shaip puede personalizar conjuntos de datos médicos por especialidad, rango de edad del paciente, género, ubicación geográfica, idioma, modalidad, entorno clínico, formato, volumen y requisitos del proyecto. Los conjuntos de datos personalizados se definen mediante una declaración de trabajo y cumplen con los estándares de anonimización y cumplimiento aplicables.
7. ¿Puedo ver un conjunto de datos de muestra antes de obtener la licencia?
Sí. Shaip proporciona conjuntos de datos de muestra representativos bajo un acuerdo de confidencialidad (NDA) para que los equipos de IA puedan evaluar el formato, la calidad, la cobertura demográfica y la idoneidad del modelo antes de obtener la licencia. El acceso a las muestras suele ser el primer paso antes de adquirir una licencia estándar o una colección personalizada.
8. ¿En qué formatos entrega Shaip los conjuntos de datos médicos?
Shaip ofrece conjuntos de datos médicos en formatos compatibles con IA, como JSON, CSV y FHIR para registros estructurados; archivos WAV con transcripciones emparejadas para audio; y archivos de transcripción para conjuntos de datos de voz y lenguaje. Los conjuntos de datos multimodales pueden incluir archivos manifiesto que vinculan texto, audio y registros clínicos estructurados.
9. ¿Cómo garantiza Shaip la calidad de los conjuntos de datos médicos?
Shaip garantiza la calidad de los conjuntos de datos médicos mediante la revisión de expertos, la anotación por especialistas del sector, los flujos de trabajo de validación y los controles de calidad estructurados. Estos procesos contribuyen a garantizar la precisión, la fiabilidad y la idoneidad de los modelos para el desarrollo de la IA en el sector sanitario.
10. ¿Son los conjuntos de datos médicos de Shaip escalables para grandes proyectos de IA/ML?
Sí. Los conjuntos de datos médicos de Shaip son escalables tanto para proyectos piloto pequeños como para proyectos empresariales de IA/aprendizaje automático. Pueden dar soporte a proyectos que requieran grandes volúmenes de historiales médicos, datos clínicos estructurados, transcripciones o cientos de miles de horas de audio de dictados médicos.
11. ¿Pueden los conjuntos de datos médicos de Shaip integrarse en los modelos y flujos de trabajo de IA existentes?
Sí. Shaip ofrece conjuntos de datos médicos en formatos listos para usar, como JSON, CSV, FHIR, WAV y archivos de transcripción. Estos formatos permiten la integración en flujos de trabajo existentes de IA, aprendizaje automático, procesamiento del lenguaje natural, reconocimiento de voz, gestión del lenguaje natural en el ámbito sanitario y desarrollo de modelos multimodales.
12. ¿Cuánto tiempo se tarda en recibir un conjunto de datos médicos de Shaip?
Los conjuntos de datos médicos predefinidos suelen entregarse en cuestión de días tras la revisión de las muestras, la firma del contrato y la formalización de la licencia. Los plazos de recopilación personalizados dependen del alcance del proyecto, el tamaño del conjunto de datos, la modalidad, los requisitos de cumplimiento y la complejidad, y se definen en la descripción del trabajo.
13. ¿Cuánto cuestan los conjuntos de datos médicos?
El coste de los conjuntos de datos médicos depende del tipo de conjunto de datos, la modalidad, el volumen, los requisitos de personalización, las condiciones de licencia, el plazo de entrega y las necesidades de cumplimiento normativo. Los equipos pueden compartir sus requisitos a través del formulario de contacto para recibir un presupuesto personalizado.
14. ¿Por qué son importantes los conjuntos de datos médicos para la IA/ML en la atención médica?
Los conjuntos de datos médicos de alta calidad son esenciales para entrenar modelos de IA sanitaria precisos, fiables y clínicamente útiles. Ayudan a mejorar la documentación médica, el procesamiento del lenguaje natural clínico, el reconocimiento de voz, la generación de resúmenes, el apoyo a la toma de decisiones, la automatización, los flujos de trabajo de atención al paciente y la inteligencia de datos sanitarios.