中文

Mulco:通过多作用域识别中文嵌套命名实体

计算与语言 2022-11-22 v1 机器学习

摘要

嵌套命名实体识别(NNER)作为命名实体识别的重要子领域,长期是研究者面临的挑战。NNER 指一个实体可能作为更长实体的一部分,且如“嵌套”一词所示可在多个层级发生。这些嵌套结构使传统序列标注方法无法妥善识别所有实体。尽管近期研究聚焦于设计多种语言的 NNER 更优识别方法,中文 NNER(CNNER)仍缺乏关注,且缺少可自由访问的 CNNER 专用基准。本文旨在通过提供中文数据集与基于学习的模型来解决 CNNER 问题。为促进该任务研究,我们发布 ChiNesE,一个 CNNER 数据集,含从多领域在线文本采样的 20,000 个句子,包含 117,284 个实体,分属 10 类,其中 43.8% 为嵌套实体。基于 ChiNesE,我们提出 Mulco,一种通过多作用域识别嵌套结构中命名实体的新方法。每个作用域使用所设计的基于作用域的序列标注方法,通过预测锚点及命名实体长度来识别实体。实验结果表明,在 ChiNesE 上 Mulco 以不同识别方案优于若干基线方法。我们还在 ACE2005 中文语料上进行了广泛实验,Mulco 相较基线方法取得了最佳性能。

关键词

引用

@article{arxiv.2211.10854,
  title  = {Mulco: Recognizing Chinese Nested Named Entities Through Multiple Scopes},
  author = {Jiuding Yang and Jinwen Luo and Weidong Guo and Jerry Chen and Di Niu and Yu Xu},
  journal= {arXiv preprint arXiv:2211.10854},
  year   = {2022}
}