基于电子健康记录的深度学习流水线用于患者诊断预测
计算机与社会
2021-02-23 v1 计算与语言
机器学习
摘要
近年来,利用机器学习算法增强医疗中的疾病诊断与决策正获得大量关注。特别是在由 COVID-19 大流行引发的当前流行病学形势下,利用机器学习算法对疾病诊断进行快速而准确的预测,有助于识别并照护诸如患有多重共病状况的脆弱人群。为构建有用的疾病诊断预测系统,数据表示与机器学习架构两方面的进展均至关重要。首先,在数据收集与表示方面,由于电子健康记录(EHRs)中普遍存在的格式繁多与缺乏一致性,我们面临严重问题。这阻碍了从 EHRs 中提取有价值的信息。目前尚未建立通用的全球数据标准。作为一项有益的解决方案,我们开发并发布了一个 Python 包,用于将公共卫生数据集转换为易于访问的通用格式。这种向国际健康数据格式的数据转换,便于研究者将 EHR 数据集与不同格式的临床数据集轻松结合。其次,可同时预测多种疾病诊断类别的机器学习算法仍欠发展。我们在此方面提出了两种新颖模型架构。其一是 DeepObserver,利用结构化数值数据预测诊断类别;其二是 ClinicalBERT_Multi,通过自然语言处理方法纳入临床笔记中的丰富信息,并为医疗从业者提供可解释的视觉化。我们表明,两种模型均能高精度地同时预测多种诊断。
引用
@article{arxiv.2006.16926,
title = {A Deep Learning Pipeline for Patient Diagnosis Prediction Using Electronic Health Records},
author = {Leopold Franz and Yash Raj Shrestha and Bibek Paudel},
journal= {arXiv preprint arXiv:2006.16926},
year = {2021}
}