中文

利用粗粒度数据集增强低资源细粒度命名实体识别

计算与语言 2023-11-14 v2 人工智能

摘要

命名实体识别 (NER) 常受标注数据不足问题的困扰,尤其在细粒度 NER 场景中。尽管可应用 KK-shot 学习技术,但当标注数量超过数十个时其性能往往趋于饱和。为克服该问题,我们利用提供大量标注的现有粗粒度数据集。解决此问题的一个直接方法是预微调,其使用粗粒度数据进行表示学习。然而,尽管细粒度实体类型很可能是粗粒度实体类型的子类别,它无法直接利用细粒度与粗粒度实体间的关系。我们提出一种带细到粗 (F2C) 映射矩阵的细粒度 NER 模型,以显式利用该层次结构。此外,我们提出一种不一致过滤方法,以消除与细粒度实体类型不一致的粗粒度实体,避免性能下降。实验结果表明,在处理少量细粒度标注时,我们的方法优于 KK-shot 学习与监督学习方法。

关键词

引用

@article{arxiv.2310.11715,
  title  = {Enhancing Low-resource Fine-grained Named Entity Recognition by Leveraging Coarse-grained Datasets},
  author = {Su Ah Lee and Seokjin Oh and Woohwan Jung},
  journal= {arXiv preprint arXiv:2310.11715},
  year   = {2023}
}

备注

Accepted to EMNLP 2023