一种面向众包序列标注的贝叶斯方法
计算与语言
2019-09-09 v3 机器学习
摘要
序列标注作为自然语言处理(NLP)中的核心任务,当前方法对数据需求量大,这促使人们将众包作为一种廉价的标注数据获取方式。然而,标注者往往不可靠,且现有的聚合方法无法捕捉常见的跨度标注错误类型。为此,我们提出一种贝叶斯序列标注聚合方法,通过对标注之间以及真值标签之间的序列依赖关系建模来减少错误。通过采用贝叶斯方法,我们考虑了由于标注者错误以及用于建模少量任务完成者的数据缺乏所导致的模型不确定性。我们在命名实体识别、信息抽取与论点挖掘的众包数据上评估了我们的模型,表明我们的序列模型优于先前的最优方法。我们还发现,我们的方法可通过更有效的主动学习降低众包成本,因为在标注稀少时能更好地捕捉序列标签中的不确定性。
引用
@article{arxiv.1811.00780,
title = {A Bayesian Approach for Sequence Tagging with Crowds},
author = {Edwin Simpson and Iryna Gurevych},
journal= {arXiv preprint arXiv:1811.00780},
year = {2019}
}
备注
Accepted for EMNLP 2019