利用非母语者标注构建低资源命名实体识别模型
计算与语言
2021-04-27 v2
摘要
在低资源自然语言处理 (NLP) 中,关键问题在于缺乏目标语言训练数据,以及缺乏创建数据的母语者。跨语言方法在解决这些难题上已取得显著成功,但在某些常见情况下,例如预训练语料不足或与源语言差异过大时,其性能会下降。本工作中,我们提出一种互补方法,利用由无目标语言先验经验的标注者提供的“非母语者”(NS) 标注来构建低资源命名实体识别 (NER) 模型。我们在一项严格控制、以印尼语、俄语和印地语为对象的标注实验中招募了 30 名参与者。我们表明,使用 NS 标注者所得结果始终与现代上下文表示之上的跨语言方法相当或更优,并且有望通过额外投入而超越后者。我们以对常见标注模式与推荐实施实践的观察作结,并阐明 NS 标注如何与既有方法结合使用以提升性能。更多细节见 http://cogcomp.org/page/publication_view/941
引用
@article{arxiv.2006.09627,
title = {Building Low-Resource NER Models Using Non-Speaker Annotation},
author = {Tatiana Tsygankova and Francesca Marini and Stephen Mayhew and Dan Roth},
journal= {arXiv preprint arXiv:2006.09627},
year = {2021}
}
备注
Accepted to DASH-LA 2021, workshop at NAACL 2021