面向低资源命名实体识别的远程监督与噪声标签学习:以 Hausa 和 Yorùbá 语为例
计算与语言
2020-04-01 v2 机器学习
摘要
标注训练数据的缺乏限制了自然语言处理工具(如命名实体识别)在许多发展中国家所用语言上的发展。远程监督与弱监督等技术可用于以(半)自动方式创建标注数据。此外,为减轻自动标注中错误的某些负面影响,可集成噪声处理方法。预训练词嵌入是大多数神经命名实体分类器的另一关键组件。随着更复杂的上下文词嵌入的出现,模型规模与性能之间出现了有趣的权衡。尽管这些技术已在高资源环境下表现良好,我们想研究其在低资源场景中的表现。本工作中,我们对 Hausa 和 Yorùbá 这两种在多个发展中国家广泛使用的语言进行命名实体识别。我们评估了不同嵌入方法,并表明在现实的低资源场景中远程监督可被成功利用,其能使分类器性能提升一倍以上。
引用
@article{arxiv.2003.08370,
title = {Distant Supervision and Noisy Label Learning for Low Resource Named Entity Recognition: A Study on Hausa and Yor\`ub\'a},
author = {David Ifeoluwa Adelani and Michael A. Hedderich and Dawei Zhu and Esther van den Berg and Dietrich Klakow},
journal= {arXiv preprint arXiv:2003.08370},
year = {2020}
}
备注
Accepted to ICLR 2020 Workshop