中文

从具有稀疏与不平衡标注的众包数据中学习

机器学习 2021-07-13 v1

摘要

传统监督学习需要训练数据的真实标签,其收集在许多情况下颇为困难。近来,众包通过借助非专家群体已确立为一种高效标注方案。为减少标注错误影响,一种常见做法是将每个样本分发给多名工人,而每名工人仅标注数据子集,导致“稀疏标注”现象。本文中我们注意到,当遇到类不平衡(即真实标签“类不平衡”)时,稀疏标注易呈偏斜分布,从而严重偏置学习算法。为应对此问题,我们提出一种基于自训练的方法,名为“Self-Crowd”,通过逐步添加高置信伪标注并重新平衡标注分布。具体而言,我们提出一种分布感知置信度度量来筛选高置信伪标注,其采用重采样策略对少数类标注过采样、对多数类标注欠采样。在一个真实众包图像分类任务上,我们表明所提方法在整个训练过程中比分布无关方法产生更平衡的标注,并在不同标注稀疏度水平下大幅提升了学习性能。

关键词

引用

@article{arxiv.2107.05039,
  title  = {Learning from Crowds with Sparse and Imbalanced Annotations},
  author = {Ye Shi and Shao-Yuan Li and Sheng-Jun Huang},
  journal= {arXiv preprint arXiv:2107.05039},
  year   = {2021}
}