PromptEHR:基于提示学习的条件下电子健康档案生成
计算与语言
2022-11-04 v1 人工智能
摘要
由于隐私问题,访问纵向多模态电子健康档案(EHRs)具有挑战性,这阻碍了机器学习在医疗健康应用中的使用。合成 EHRs 生成规避了共享敏感真实患者记录的需求。然而,现有方法通过无条件生成或纵向推断生成单模态 EHRs,灵活性低且生成的 EHRs 不真实。本工作中,我们提出将 EHRs 生成表述为语言模型(LMs)下的文本到文本翻译任务,这足以在生成过程中实现高度灵活的事件插补。我们还设计了提示学习,以数值与类别人口统计学特征为条件控制生成。我们通过两种困惑度度量评估合成 EHRs 质量,分别刻画其纵向模式(纵向插补困惑度,lpl)与跨模态关联(跨模态插补困惑度,mpl)。此外,我们利用成员推断与属性推断两种对抗攻击进行隐私保护评估。在 MIMIC-III 数据上的实验表明,我们的方法在真实 EHRs 生成上优于现有最佳基线(lpl 平均降低 53.1%,mpl 平均降低 45.3%)且隐私风险低。软件见 https://github.com/RyanWangZf/PromptEHR。
引用
@article{arxiv.2211.01761,
title = {PromptEHR: Conditional Electronic Healthcare Records Generation with Prompt Learning},
author = {Zifeng Wang and Jimeng Sun},
journal= {arXiv preprint arXiv:2211.01761},
year = {2022}
}
备注
EMNLP 2022