中文

面向开放领域命名实体识别的神经校正模型

计算与语言 2020-11-03 v2 信息检索 机器学习

摘要

命名实体识别(NER)在关系抽取、问答等广泛的自然语言处理任务中起着重要作用。然而,以往关于NER的研究局限于特定体裁,使用小规模人工标注或大规模但低质量的数据集。同时,以往使用远程监督构建的开放领域NER数据集存在精确率低、召回率低以及标注词元比率(RAT)低的问题。在本工作中,为解决低精确率和低召回率问题,我们首先利用DBpedia作为远程监督来源标注维基百科摘要,并设计了一个用人工标注的NER数据集DocRED训练的神经校正模型,以纠正错误的实体标签。由此我们构建了名为AnchorNER的大规模高质量数据集,并用其训练了多种模型。为解决以往数据集的低RAT问题,我们引入了一种多任务学习方法来利用上下文信息。我们在五个NER数据集上评估了我们的方法,实验结果表明,使用AnchorNER和我们的多任务学习方法训练的模型在开放领域设定下取得了最先进的性能。

关键词

引用

@article{arxiv.1909.06058,
  title  = {Neural Correction Model for Open-Domain Named Entity Recognition},
  author = {Mengdi Zhu and Zheye Deng and Wenhan Xiong and Mo Yu and Ming Zhang and William Yang Wang},
  journal= {arXiv preprint arXiv:1909.06058},
  year   = {2020}
}