中文

用于患者结局预测的文本数据增强

计算与语言 2022-11-15 v1 人工智能

摘要

深度学习模型已在多种医疗应用中展现出优越性能。然而,这些深度模型的主要局限通常在于缺乏高质量训练数据,这是由该领域的私密性与敏感性所致。在本研究中,我们提出一种新颖的文本数据增强方法,用于生成患者电子健康记录(EHR)中的人工临床笔记,可作为患者结局预测的额外训练数据。本质上,我们对生成式语言模型 GPT-2 进行微调,以利用原始训练数据合成带标签文本。更具体地,我们提出一种师生框架:首先在原始数据上预训练教师模型,然后在教师指导下于 GPT 增强数据上训练学生模型。我们在最常见的患者结局即 30 天再入院率上评估了我们的方法。实验结果表明,深度模型可借助增强数据提升其预测性能,表明所提架构的有效性。

关键词

引用

@article{arxiv.2211.06778,
  title  = {Textual Data Augmentation for Patient Outcomes Prediction},
  author = {Qiuhao Lu and Dejing Dou and Thien Huu Nguyen},
  journal= {arXiv preprint arXiv:2211.06778},
  year   = {2022}
}

备注

BIBM 2021