面向电子健康记录的自然语言生成
计算与语言
2018-12-18 v1 机器学习
机器学习
摘要
现有多种生成合成电子健康记录(EHR)的方法,但它们无法生成非结构化文本,如急诊科(ED)主诉、现病史或病程记录。在此,我们使用编码器-解码器模型——一种在许多当代机器翻译系统中出现的深度学习算法——从EHR中的离散变量(如年龄组、性别和出院诊断)生成合成主诉。在真实记录上端到端训练后,该模型可生成保留原始数据中大量流行病学信息的逼真主诉文本。作为模型优化目标的一个副作用,这些合成主诉也不含相对少见的缩写和拼写错误,并且不包含训练数据中的任何个人可识别信息(PII),表明其可用于支持EHR中文本的去标识化。当与生成对抗网络(GAN)等算法结合时,我们的模型可用于生成完全合成的EHR,促进医疗保健提供者与研究人员之间的数据共享,并提升我们开发针对医疗数据信息的机器学习方法的能力。
引用
@article{arxiv.1806.01353,
title = {Natural Language Generation for Electronic Health Records},
author = {Scott Lee},
journal= {arXiv preprint arXiv:1806.01353},
year = {2018}
}