将不连续命名实体识别视为极大团发现
计算与语言
2021-11-29 v2
摘要
当实体提及可能不连续时,命名实体识别(NER)仍然具有挑战性。现有方法将识别过程拆分为若干顺序步骤。在训练时,它们以黄金中间结果为条件进行预测,而在推理时依赖前一步的模型输出,这引入了暴露偏差。为解决该问题,我们首先为每句话构建一个片段图,其中每个节点表示一个片段(自身为连续实体,或不连续实体的一部分),边连接属于同一实体的两个节点。节点和边可分别通过网格标注方案在单阶段生成,并使用名为 Mac 的新颖架构联合学习。随后,不连续 NER 可重新表述为在图中发现极大团并将每个团中的跨度拼接的非参数过程。在三个基准上的实验表明,我们的方法优于最先进的(SOTA)结果,F1 最高提升 3.5 个百分点,并比 SOTA 模型快 5 倍。
引用
@article{arxiv.2106.00218,
title = {Discontinuous Named Entity Recognition as Maximal Clique Discovery},
author = {Yucheng Wang and Bowen Yu and Hongsong Zhu and Tingwen Liu and Nan Yu and Limin Sun},
journal= {arXiv preprint arXiv:2106.00218},
year = {2021}
}
备注
ACL 2021, https://github.com/131250208/InfExtraction