中文

利用汉字字形进行命名实体识别

计算与语言 2020-02-13 v2 人工智能 信息检索 机器学习

摘要

大多数命名实体识别(NER)系统使用额外特征,如词性(POS)标签、浅层句法分析、地名词典等。此类信息需要外部知识,如未标注文本和训练好的标注器。将这些特征加入 NER 系统已被证明具有积极作用。然而,有时创建地名词典或标注器可能耗费大量时间,并可能需要广泛的数据清洗。在本文中,针对中文 NER 系统,我们不使用这些传统特征,而是使用汉字的字形特征。汉字由称为部首的图形部件组成,这些部件常有某些语义指示。我们提出基于 CNN 的模型,将此类语义信息整合并用于 NER。我们的模型相比基线 BERT-BiLSTM-CRF 模型有所提升。我们在中文 OntoNotes v5.0 上设定了新的基线分数,并显示出 +.64 F1 分数的提升。我们在 Weibo 数据集上给出了 71.81 的当前最优 F1 分数,并在 ResumeNER 数据集上相比基线显示出 +0.72 的竞争性提升。

关键词

引用

@article{arxiv.1909.09922,
  title  = {Using Chinese Glyphs for Named Entity Recognition},
  author = {Arijit Sehanobish and Chan Hee Song},
  journal= {arXiv preprint arXiv:1909.09922},
  year   = {2020}
}

备注

Extended abstract accepted to AAAI-2020, student track