中文

面向低资源命名实体识别的软地名词典

计算与语言 2020-05-06 v1

摘要

传统的命名实体识别模型使用地名词典(实体列表)作为特征来提高性能。尽管现代神经网络模型无需此类手工特征即可获得强大性能,但最近的研究已证明它们在英文数据的命名实体识别中具有实用性。然而,为低资源语言设计此类特征颇具挑战,因为这些语言中不存在详尽的实体地名词典。为解决此问题,我们提出了一种“软地名词典”方法,通过跨语言实体链接,将来自英文知识库(如维基百科)的普遍可用信息融入神经命名实体识别模型。我们在四种低资源语言上的实验显示,F1 分数平均提高了 4 个点。代码和数据可在 https://github.com/neulab/soft-gazetteers 获取。

关键词

引用

@article{arxiv.2005.01866,
  title  = {Soft Gazetteers for Low-Resource Named Entity Recognition},
  author = {Shruti Rijhwani and Shuyan Zhou and Graham Neubig and Jaime Carbonell},
  journal= {arXiv preprint arXiv:2005.01866},
  year   = {2020}
}

备注

Accepted at ACL 2020