中文

Few-NERD:一个少样本命名实体识别数据集

计算与语言 2021-09-02 v6 人工智能 机器学习

摘要

近年来,围绕少样本命名实体识别(NER)主题的文献大量涌现,但专门针对这一实用且具有挑战性任务的已发布基准数据很少。现有方法收集已有的有监督 NER 数据集,并将其重新组织为少样本设定以进行实证研究。这些策略通常旨在用少量样本识别粗粒度实体类型,而在实践中,大多数未见过的实体类型都是细粒度的。本文提出 Few-NERD,一个大规模人工标注的少样本 NER 数据集,具有包含 8 个粗粒度和 66 个细粒度实体类型的层次结构。Few-NERD 由来自维基百科的 188,238 个句子组成,包含 4,601,160 个单词,每个单词被标注为上下文或两级实体类型的一部分。据我们所知,这是首个少样本 NER 数据集,也是最大的人工构建 NER 数据集。我们构建了具有不同侧重点的基准任务,以全面评估模型的泛化能力。大量实证结果和分析表明 Few-NERD 具有挑战性,且该问题需要进一步研究。我们在 https://ningding97.github.io/fewnerd/ 公开了 Few-NERD。

关键词

引用

@article{arxiv.2105.07464,
  title  = {Few-NERD: A Few-Shot Named Entity Recognition Dataset},
  author = {Ning Ding and Guangwei Xu and Yulin Chen and Xiaobin Wang and Xu Han and Pengjun Xie and Hai-Tao Zheng and Zhiyuan Liu},
  journal= {arXiv preprint arXiv:2105.07464},
  year   = {2021}
}

备注

Accepted by ACL-IJCNLP 2021 (long paper), update