利用神经语言模型自动生成可共享的合成临床笔记
计算与语言
2019-05-23 v2
摘要
大规模临床数据对推动当今许多计算科学进展具有不可估量的价值。然而,对患者隐私的合理担忧阻碍了此类数据的开放传播,并导致次优的孤岛式研究。去标识化方法试图解决这些担忧,但已被证明易受对抗攻击。在这项工作中,我们关注存储于临床笔记中的大量非结构化自然语言数据,并提出使用在真实去标识化记录上训练的生成模型,自动生成更易于共享的合成临床笔记。为评估此类笔记的价值,我们度量了其隐私保护特性以及在训练临床 NLP 模型中的效用。使用神经语言模型的实验生成的笔记在某些临床 NLP 任务中的效用接近真实笔记,但仍有很大改进空间。
引用
@article{arxiv.1905.07002,
title = {Towards Automatic Generation of Shareable Synthetic Clinical Notes Using Neural Language Models},
author = {Oren Melamud and Chaitanya Shivade},
journal= {arXiv preprint arXiv:1905.07002},
year = {2019}
}
备注
Clinical NLP Workshop 2019