中文

少量标注大有裨益:低资源命名实体识别器的自举研究

计算与语言 2019-08-27 v1

摘要

大多数最先进的命名实体识别(NER)模型依赖于大量标注数据的可用性,使其难以扩展到新的、资源更少的语言。然而,现已提出若干方法,涉及从其他高资源语言学习的跨语言迁移学习,或基于模型预测高效筛选有效训练数据的主动学习。本文提出一个问题:鉴于近期进展与有限人工标注,何为在低资源语言中高效创建高质量实体识别器的最有效方法?基于使用模拟与真实人工标注的广泛实验,我们发现双策略方法最佳:先以跨语言迁移模型起步,再仅对目标语言中不确定实体跨度进行针对性标注,以最小化标注者工作量。结果表明,在极少数据可标注时跨语言迁移是强大工具,但实体针对性标注策略仅需十分之一训练数据即可快速达到有竞争力的准确率。

关键词

引用

@article{arxiv.1908.08983,
  title  = {A Little Annotation does a Lot of Good: A Study in Bootstrapping Low-resource Named Entity Recognizers},
  author = {Aditi Chaudhary and Jiateng Xie and Zaid Sheikh and Graham Neubig and Jaime G. Carbonell},
  journal= {arXiv preprint arXiv:1908.08983},
  year   = {2019}
}

备注

Accepted at EMNLP 2019