中文

PHICON:通过数据增强提升临床文本去标识模型的泛化能力

计算与语言 2020-10-13 v1

摘要

去标识是识别临床文本中受保护健康信息(PHI)的任务。现有的神经去标识模型常无法泛化到新数据集。我们提出一种简单而有效的数据增强方法 PHICON 以缓解泛化问题。PHICON 由 PHI 增强与上下文增强组成,前者用从外部来源采样的命名实体替换 PHI 实体来创建增强训练语料,后者分别通过同义词替换或随机词插入来改变背景上下文。在 i2b2 2006 与 2014 去标识挑战数据集上的实验结果表明,PHICON 可帮助三个所选去标识模型在跨数据集测试设定下提升 F1 分数(至多 8.6%)。我们还讨论了应使用多少增强以及每种增强方法如何影响性能。

关键词

引用

@article{arxiv.2010.05143,
  title  = {PHICON: Improving Generalization of Clinical Text De-identification Models via Data Augmentation},
  author = {Xiang Yue and Shuang Zhou},
  journal= {arXiv preprint arXiv:2010.05143},
  year   = {2020}
}

备注

Accepted by The 3rd ClinicalNLP Workshop at EMNLP'20