中文

迈向半监督学习的去偏训练:TaMatch框架

机器学习 2024-09-30 v1 机器学习

摘要

半监督学习(SSL)表现出明显的确认偏差,即模型过度偏向某些类别,导致预测伪标签中的错误在自训练范式下不断累积。与受益于丰富、静态数据分布的有监督设置不同,SSL 本质上缺乏纠正这种自我强化偏差的机制,因此需要在每个训练步骤中进行去偏干预。尽管去偏伪标签的生成已被广泛研究,但其有效利用仍未得到充分探索。我们的分析表明,来自有偏类别的数据对参数更新的影响应减小,而应更多关注代表性不足的类别。为应对这些挑战,我们引入了 TaMatch,一个用于 SSL 去偏训练的统一框架。TaMatch 利用由先验目标分布和模型学习状态共同导出的缩放比率,在每个训练步骤估计并纠正偏差。该比率调整未标记数据上的原始预测,以生成去偏伪标签。在利用阶段,这些标签根据其预测类别被赋予不同权重,从而增强训练公平性并最小化类别偏差。此外,TaMatch 根据模型的学习进度动态调整目标分布,从而在实际应用中先验分布未知的情况下也能稳健处理。实证评估表明,TaMatch 在一系列具有挑战性的图像分类任务中显著优于现有最先进方法,凸显了 SSL 中去偏伪标签生成与利用的关键重要性。

关键词

引用

@article{arxiv.2409.18316,
  title  = {Towards the Mitigation of Confirmation Bias in Semi-supervised Learning: a Debiased Training Perspective},
  author = {Yu Wang and Yuxuan Yin and Peng Li},
  journal= {arXiv preprint arXiv:2409.18316},
  year   = {2024}
}

备注

11 pages, 4 figures