中文

命名实体识别中的泛化:定量分析

计算与语言 2017-03-09 v2

摘要

命名实体识别(NER)是一项关键的自然语言处理(NLP)任务,在具有多样且不断变化语言的网络和用户生成内容上更具挑战性。本文旨在通过测量命名实体(NE)与上下文变异性、特征稀疏性及其对精确率和召回率的影响,量化这种多样性如何影响最先进的 NER 方法。特别地,我们的研究结果表明,在训练数据有限的多样化体裁中,NER 方法难以泛化。尤其是未登录命名实体(Unseen NEs)起着重要作用,其在社交媒体等多样化体裁中的出现频率高于新闻专线等较规整体裁。再加上更普遍地未登录特征出现频率更高以及缺乏大型训练语料库,这导致多样化体裁的 F1 分数相比较规整体裁显著更低。我们还发现,领先的系统严重依赖训练数据中出现的表面形式,难以泛化到这些形式之外,并针对该现象给出了解释。

关键词

引用

@article{arxiv.1701.02877,
  title  = {Generalisation in Named Entity Recognition: A Quantitative Analysis},
  author = {Isabelle Augenstein and Leon Derczynski and Kalina Bontcheva},
  journal= {arXiv preprint arXiv:1701.02877},
  year   = {2017}
}

备注

Preprint, accepted to Computer Speech and Language