缩小差距:临床领域中的联合去标识与概念抽取
计算与语言
2020-05-20 v1 机器学习
摘要
在临床领域利用自然语言处理需要进行去标识,即对文本中的个人信息进行匿名化。然而,当前研究仅孤立地考虑去标识与下游任务(如概念抽取),并未研究去标识对其他任务的影响。在本文中,我们通过报告在自动匿名化数据上的概念抽取性能并研究去标识与概念抽取的联合模型,弥补了这一差距。具体而言,我们提出了一种对隐私敏感信息访问受限的堆叠模型以及一种多任务模型。我们在英语基准数据集(去标识 F1 为 96.1%,概念抽取 F1 为 88.9%)和西班牙语基准数据集(概念抽取 F1 为 91.4%)上确立了新的 SOTA。
引用
@article{arxiv.2005.09397,
title = {Closing the Gap: Joint De-Identification and Concept Extraction in the Clinical Domain},
author = {Lukas Lange and Heike Adel and Jannik Strötgen},
journal= {arXiv preprint arXiv:2005.09397},
year = {2020}
}
备注
ACL 2020