中文

利用神经语言模型自动生成可共享的合成临床笔记

计算与语言 2019-05-23 v2

摘要

大规模临床数据对推动当今许多计算科学进展具有不可估量的价值。然而,对患者隐私的合理担忧阻碍了此类数据的开放传播,并导致次优的孤岛式研究。去标识化方法试图解决这些担忧,但已被证明易受对抗攻击。在这项工作中,我们关注存储于临床笔记中的大量非结构化自然语言数据,并提出使用在真实去标识化记录上训练的生成模型,自动生成更易于共享的合成临床笔记。为评估此类笔记的价值,我们度量了其隐私保护特性以及在训练临床 NLP 模型中的效用。使用神经语言模型的实验生成的笔记在某些临床 NLP 任务中的效用接近真实笔记,但仍有很大改进空间。

关键词

引用

@article{arxiv.1905.07002,
  title  = {Towards Automatic Generation of Shareable Synthetic Clinical Notes Using Neural Language Models},
  author = {Oren Melamud and Chaitanya Shivade},
  journal= {arXiv preprint arXiv:1905.07002},
  year   = {2019}
}

备注

Clinical NLP Workshop 2019