术语增强的循环神经网络模型用于临床命名实体识别
计算与语言
2019-05-16 v2
摘要
我们旨在利用医学术语提升有监督模型用于临床命名实体识别(NER)的性能。为在法语上评估我们的系统,我们构建了涵盖 5 类临床实体的语料库。我们使用基于术语的系统作为基线,构建于 UMLS 和 SNOMED 之上。随后,我们评估了 biGRU-CRF,以及一个将该基于术语系统的预测作为 biGRU-CRF 特征的混合系统。在英语上,我们在 i2b2-2009 药物名称识别挑战赛上评估 NER 系统,其包含 268 篇文档中的 8,573 个实体。在法语上,我们构建了 APcNER,一个包含 147 篇文档、标注了 5 类实体(药物名称、体征或症状、疾病或障碍、诊断程序或化验、治疗程序)的语料库。我们使用 NER 的精确匹配与部分匹配 F 值定义评估各 NER 系统。APcNER 包含 4,837 个实体,标注耗时 28 小时,标注者间一致性在药物名称精确匹配上可接受(85%),在其他实体类型的非精确匹配上可接受(>70%)。在 i2b2-2009 与 APcNER 上的药物名称识别中,biGRU-CRF 表现优于基于术语的系统,精确匹配 F 值分别为 91.1% 对 73% 和 81.9% 对 75%。此外,混合系统优于 biGRU-CRF,精确匹配 F 值分别为 92.2% 对 91.1%(i2b2-2009)和 88.4% 对 81.9%(APcNER)。在 APcNER 语料库上,混合系统对 5 类实体的微平均精确匹配 F 值为 69.5%,非精确匹配为 84.1%。APcNER 是一个涵盖多种文档类型、包含五类实体的法语临床 NER 语料库。用术语扩展有监督模型可轻松带来性能提升,尤其在实体低频情况下,并在 i2b2-2009 语料库上取得了接近 SOTA 的结果。
引用
@article{arxiv.1904.11473,
title = {Terminologies augmented recurrent neural network model for clinical named entity recognition},
author = {Ivan Lerner and Nicolas Paris and Xavier Tannier},
journal= {arXiv preprint arXiv:1904.11473},
year = {2019}
}