中文

EVA:使用条件变分自编码器生成纵向电子健康记录

机器学习 2020-12-21 v1 人工智能

摘要

研究人员需要及时访问真实世界的纵向电子健康记录(EHR),以开发、测试、验证和实施可提升医疗质量与效率的机器学习解决方案。相比之下,医疗系统高度重视患者隐私与数据安全。去标识化的EHR无法充分满足医疗系统的需求,因为去标识化数据存在再识别风险且数据量有限。合成EHR提供了一种潜在解决方案。本文中,我们提出EHR变分自编码器(EVA),用于合成离散EHR就诊事件(如临床就诊)及就诊特征(如诊断、用药、操作)的序列。我们说明EVA能够生成逼真的EHR序列,考虑患者间的个体差异,并可基于特定疾病条件进行条件生成,从而支持疾病特异性研究。我们通过将随机梯度马尔可夫链蒙特卡洛与摊销变分推断相结合,设计了高效准确的推断算法。我们在包含超过250,000名患者的大型真实世界EHR库上评估了方法的实用性。我们的实验(包括由资深临床医生参与的用户研究)表明生成的EHR序列是逼真的。我们证实在合成数据上训练的预测模型性能与在真实EHR上训练的模型相近。此外,我们的结果表明,用合成EHR增强真实数据可取得最佳预测性能——在top-20召回率上比最佳基线提升高达8%。

关键词

引用

@article{arxiv.2012.10020,
  title  = {EVA: Generating Longitudinal Electronic Health Records Using Conditional Variational Autoencoders},
  author = {Siddharth Biswal and Soumya Ghosh and Jon Duke and Bradley Malin and Walter Stewart and Jimeng Sun},
  journal= {arXiv preprint arXiv:2012.10020},
  year   = {2020}
}