利用粗粒度数据集增强低资源细粒度命名实体识别
计算与语言
2023-11-14 v2 人工智能
摘要
命名实体识别 (NER) 常受标注数据不足问题的困扰,尤其在细粒度 NER 场景中。尽管可应用 -shot 学习技术,但当标注数量超过数十个时其性能往往趋于饱和。为克服该问题,我们利用提供大量标注的现有粗粒度数据集。解决此问题的一个直接方法是预微调,其使用粗粒度数据进行表示学习。然而,尽管细粒度实体类型很可能是粗粒度实体类型的子类别,它无法直接利用细粒度与粗粒度实体间的关系。我们提出一种带细到粗 (F2C) 映射矩阵的细粒度 NER 模型,以显式利用该层次结构。此外,我们提出一种不一致过滤方法,以消除与细粒度实体类型不一致的粗粒度实体,避免性能下降。实验结果表明,在处理少量细粒度标注时,我们的方法优于 -shot 学习与监督学习方法。
引用
@article{arxiv.2310.11715,
title = {Enhancing Low-resource Fine-grained Named Entity Recognition by Leveraging Coarse-grained Datasets},
author = {Su Ah Lee and Seokjin Oh and Woohwan Jung},
journal= {arXiv preprint arXiv:2310.11715},
year = {2023}
}
备注
Accepted to EMNLP 2023