一种上下文增强的去标识化系统
计算与语言
2021-02-18 v1
摘要
许多现代实体识别系统,包括当前最先进的去标识化系统,都基于双向长短期记忆(biLSTM)单元并辅以条件随机场(CRF)序列优化器。这些系统逐句处理输入。这种方法使系统无法捕捉跨句边界的依赖关系,并使准确的句子边界检测成为先决条件。由于句子边界检测可能存在问题,尤其在临床报告中跨句边界的依赖关系和共指现象大量存在,这些系统具有明显的局限性。在本研究中,我们基于当前最先进去标识化系统之一 NeuroNER 的框架构建了一个新系统,以克服这些局限。该新系统通过前向和后向 n-gram 融入上下文嵌入,而不使用句子边界。我们的上下文增强去标识化(CEDI)系统捕捉跨句边界的依赖关系,并完全绕开了句子边界检测问题。我们通过深度词缀特征和注意力机制增强了该系统,以捕捉输入的相关部分。CEDI 系统在 2006 i2b2 去标识化挑战数据集、2014 i2b2 共享任务去标识化数据集和 2016 CEGS N-GRID 去标识化数据集上优于 NeuroNER(p<0.01)。所有数据集均包含英文叙述性临床报告,但涵盖从出院小结到精神科记录的不同记录类型。以深度词缀特征和注意力机制增强 CEDI 进一步提升了性能。
引用
@article{arxiv.2102.08513,
title = {A Context-Enhanced De-identification System},
author = {Kahyun Lee and Mehmet Kayaalp and Sam Henry and Özlem Uzuner},
journal= {arXiv preprint arXiv:2102.08513},
year = {2021}
}