中文

简单问题生成命名实体识别数据集

计算与语言 2022-11-08 v4

摘要

近期的命名实体识别(NER)模型常依赖人工标注数据集,需要在目标领域与实体上投入大量专业知识。本研究引入一种询问生成方法,通过向开放域问答系统(例如“哪种疾病?”)以简单自然语言提问,自动生成NER数据集。尽管使用了更少的领域内资源,我们仅在该生成数据集上训练的模型,在六个流行NER基准上以平均19.4的F1分数大幅优于强低资源模型。此外,我们的模型提供了与利用领域专家提供的领域内词典的富资源模型相竞争的性能。在少样本NER中,我们在三个基准上以5.2的F1分数优于先前最佳模型,并达到了新的最先进性能。

关键词

引用

@article{arxiv.2112.08808,
  title  = {Simple Questions Generate Named Entity Recognition Datasets},
  author = {Hyunjae Kim and Jaehyo Yoo and Seunghyun Yoon and Jinhyuk Lee and Jaewoo Kang},
  journal= {arXiv preprint arXiv:2112.08808},
  year   = {2022}
}

备注

EMNLP 2022. Code and datasets available at https://github.com/dmis-lab/GeNER