将众包学习视为域适应:以命名实体识别为例
计算与语言
2021-11-16 v2 人机交互
机器学习
摘要
众包被视为有效监督学习的一种前景广阔的解决方案,旨在通过众包工作者构建大规模标注训练数据。以往研究侧重于减少众包标注噪声对监督模型的影响。我们在本工作中采取不同视角,将全部众包标注视为相对于各个标注者的金标准。如此,我们发现众包可高度类似于域适应,进而跨域方法的近期进展几乎可直接应用于众包。此处我们以命名实体识别(NER)为研究案例,提出一种标注者感知的表示学习模型,其受试图捕捉有效域感知特征的域适应方法启发。我们考察了无监督与有监督的众包学习,假设无或仅有小规模的专家标注可用。在基准众包 NER 数据集上的实验结果表明,我们的方法极为有效,取得了新的最先进性能。此外,在有监督设定下,我们仅用非常小规模的专家标注即可获得显著的性能提升。
引用
@article{arxiv.2105.14980,
title = {Crowdsourcing Learning as Domain Adaptation: A Case Study on Named Entity Recognition},
author = {Xin Zhang and Guangwei Xu and Yueheng Sun and Meishan Zhang and Pengjun Xie},
journal= {arXiv preprint arXiv:2105.14980},
year = {2021}
}
备注
ACL-IJCNLP 2021 main conf, long paper; corrected the wrong reference for "argument retrieval" in first paragraph of Introduction