中文

NeuCrowd:面向众包标签表示学习的神经采样网络

机器学习 2021-12-17 v4 人工智能 机器学习

摘要

表示学习方法需要大量有判别力的训练数据,这在许多场景(如医疗、智慧城市、教育等)中难以获取。实践中,人们借助众包来获取标注标签。然而,由于数据隐私、预算限制、领域标注者短缺等问题,众包标签的数量仍非常有限。此外,由于标注者专业水平各异,众包标签常不一致。因此,直接应用现有监督表示学习(SRL)算法易出现过拟合问题并得出次优解。本文提出 \emph{NeuCrowd},一种基于众包标签的 SRL 统一框架。该框架(1)通过安全感知采样与鲁棒锚点生成,创建足量高质量的 \emph{n} 元训练样本;(2)自动学习神经采样网络,自适应地选择有效样本供 SRL 网络使用。所提框架在一个合成与三个真实数据集上评估,结果显示我们的方法在预测精度与 AUC 上优于广泛使用的 SOTA 基线。为鼓励可复现结果,我们公开代码于 \url{https://github.com/tal-ai/NeuCrowd_KAIS2021}。

关键词

引用

@article{arxiv.2003.09660,
  title  = {NeuCrowd: Neural Sampling Network for Representation Learning with Crowdsourced Labels},
  author = {Yang Hao and Wenbiao Ding and Zitao Liu},
  journal= {arXiv preprint arXiv:2003.09660},
  year   = {2021}
}

备注

Accepted in Knowledge and Information Systems