中文

半监督学习中使用 FixMatch 对带标签数据过采样的分析

机器学习 2022-04-11 v2 计算机视觉与模式识别

摘要

大多数半监督学习方法在构造训练小批量时对带标签数据进行过采样。本文研究这一常见做法是否能改善学习及其原因。我们将其与另一种设定进行比较:每个小批量从所有训练数据(无论有无标签)中均匀采样,这在典型的低标签情形下极大减少来自真实标签的直接监督。然而,这一更简单的设定也可视为更通用甚至必要,在多任务问题中过采样带标签数据会变得难以处理。我们在使用 FixMatch 的半监督 CIFAR-10 图像分类上的实验显示,采用均匀采样方法时性能下降,而当带标签数据量或训练时间增加时该下降减弱。进一步,我们分析训练动态以理解带标签数据过采样与均匀采样之比较。我们的主要发现是:过采样在训练早期尤其有益,但在后期当更多伪标签变正确时变得不那么重要。尽管如此,我们也发现保留一些真实标签对于避免来自不正确伪标签的确认误差累积仍然重要。

关键词

引用

@article{arxiv.2201.00604,
  title  = {An analysis of over-sampling labeled data in semi-supervised learning with FixMatch},
  author = {Miquel Martí i Rabadán and Sebastian Bujwid and Alessandro Pieropan and Hossein Azizpour and Atsuto Maki},
  journal= {arXiv preprint arXiv:2201.00604},
  year   = {2022}
}

备注

10 pages, 3 figures. Published at NLDL 2022