中文

将统一命名实体识别作为词-词关系分类

计算与语言 2021-12-21 v1

摘要

迄今为止,命名实体识别(NER)涉及三种主要类型,包括扁平、重叠(又称嵌套)和不连续 NER,这些类型大多被单独研究。近来,针对统一 NER 的兴趣日益增长,即用单一模型同时处理上述三项任务。当前性能最佳的方法主要包括基于跨度(span-based)和序列到序列(sequence-to-sequence)的模型,遗憾的是前者仅关注边界识别,而后者可能受暴露偏差(exposure bias)影响。在本工作中,我们提出一种新颖的替代方案,将统一 NER 建模为词-词关系分类,即 W^2NER。该架构通过以 Next-Neighboring-Word(NNW)和 Tail-Head-Word-*(THW-*)关系有效建模实体词之间的相邻关系,解决了统一 NER 的核心瓶颈。基于 W^2NER 方案我们开发了一个神经框架,其中统一 NER 被建模为词对的二维网格。随后我们提出多粒度二维卷积以更好地精炼网格表示。最后,使用协同预测器(co-predictor)充分推理词-词关系。我们在 14 个广泛使用的基准数据集(8 个英文和 6 个中文数据集)上针对扁平、重叠和不连续 NER 进行了大量实验,我们的模型击败了所有当前性能最佳的基线,推动了统一 NER 的 SOTA 性能。

关键词

引用

@article{arxiv.2112.10070,
  title  = {Unified Named Entity Recognition as Word-Word Relation Classification},
  author = {Jingye Li and Hao Fei and Jiang Liu and Shengqiong Wu and Meishan Zhang and Chong Teng and Donghong Ji and Fei Li},
  journal= {arXiv preprint arXiv:2112.10070},
  year   = {2021}
}

备注

Accepted by AAAI'22