中文

面向支持医生研究活动的电子健康记录疾病数据提取的系统建模

机器学习 2024-04-02 v1 信息检索

摘要

电子健康记录(EHR)的使用在过去15年中急剧增加,因为它被认为是管理患者数据的重要来源。EHR是全球患者疾病诊断和人口统计数据的主要来源。因此,这些数据可用于研究等次要任务。本文旨在使此类数据可用于研究活动,例如监测特定人群的疾病统计。因此,研究人员可以检测目标群体行为和生活方式导致的疾病原因。EHR系统的局限性之一是数据并非以标准格式提供,而是以多种形式存在。因此,需要首先将疾病名称和人口统计数据转换为一种标准化形式,使其可用于研究活动。存在大量的EHR,解决标准化问题需要一些优化技术。我们使用了从EHR系统中提取的第一手EHR数据集。我们的应用程序从EHR中上传数据集,并将其转换为ICD-10编码系统以解决标准化问题。因此,我们首先应用预处理、标注和转换步骤,将数据转换为标准形式。数据预处理用于规范化人口统计格式。在标注步骤中,使用机器学习模型从文本中识别疾病。此外,转换步骤将疾病名称转换为ICD-10编码格式。通过将其在疾病识别方面的性能与基于字典的系统(MetaMap)进行比较,对模型进行了手动评估。所提出的机器学习模型的准确率为81%,优于MetaMap的67%准确率。本文为支持研究活动的EHR数据提取做出了系统建模贡献。

关键词

引用

@article{arxiv.2404.01218,
  title  = {Towards System Modelling to Support Diseases Data Extraction from the Electronic Health Records for Physicians Research Activities},
  author = {Bushra F. Alsaqer and Alaa F. Alsaqer and Amna Asif},
  journal= {arXiv preprint arXiv:2404.01218},
  year   = {2024}
}

备注

15 pages, 18 figures and 12 tables