中文

将众包学习视为域适应:以命名实体识别为例

计算与语言 2021-11-16 v2 人机交互 机器学习

摘要

众包被视为有效监督学习的一种前景广阔的解决方案,旨在通过众包工作者构建大规模标注训练数据。以往研究侧重于减少众包标注噪声对监督模型的影响。我们在本工作中采取不同视角,将全部众包标注视为相对于各个标注者的金标准。如此,我们发现众包可高度类似于域适应,进而跨域方法的近期进展几乎可直接应用于众包。此处我们以命名实体识别(NER)为研究案例,提出一种标注者感知的表示学习模型,其受试图捕捉有效域感知特征的域适应方法启发。我们考察了无监督与有监督的众包学习,假设无或仅有小规模的专家标注可用。在基准众包 NER 数据集上的实验结果表明,我们的方法极为有效,取得了新的最先进性能。此外,在有监督设定下,我们仅用非常小规模的专家标注即可获得显著的性能提升。

关键词

引用

@article{arxiv.2105.14980,
  title  = {Crowdsourcing Learning as Domain Adaptation: A Case Study on Named Entity Recognition},
  author = {Xin Zhang and Guangwei Xu and Yueheng Sun and Meishan Zhang and Pengjun Xie},
  journal= {arXiv preprint arXiv:2105.14980},
  year   = {2021}
}

备注

ACL-IJCNLP 2021 main conf, long paper; corrected the wrong reference for "argument retrieval" in first paragraph of Introduction