命名实体识别中未标注实体问题的实证分析
计算与语言
2021-03-19 v5
摘要
在许多场景中,命名实体识别(NER)模型严重受困于未标注实体问题,即一个句子的实体可能未被完全标注。通过在合成数据集上进行的实证研究,我们发现性能下降的两个原因。一是标注实体的减少,二是将未标注实体视为负例。第一个原因的影响小于第二个原因,并且可通过采用预训练语言模型来缓解。第二个原因在训练中严重误导模型并极大影响其性能。基于上述观察,我们提出一种通用方法,几乎可以消除未标注实体带来的误导。其核心思想是使用负采样,在很大程度上避免用未标注实体训练 NER 模型。在合成数据集和真实世界数据集上的实验表明,我们的模型对未标注实体问题具有鲁棒性,并超越了先前的基线。在标注良好的数据集上,我们的模型与最先进方法具有竞争力。
引用
@article{arxiv.2012.05426,
title = {Empirical Analysis of Unlabeled Entity Problem in Named Entity Recognition},
author = {Yangming Li and Lemao Liu and Shuming Shi},
journal= {arXiv preprint arXiv:2012.05426},
year = {2021}
}
备注
Accepted as a conference paper at ICLR 2021