中文

MaskMatch:通过掩码自编码器驱动的特征学习提升半监督学习

计算机视觉与模式识别 2024-05-13 v1

摘要

传统的半监督学习方法通常面临数据利用率有限的挑战,这主要是因为它们在训练过程中依赖基于阈值的技术来选择高置信度的无标签数据。为了通过调整阈值来提高数据利用率,人们做出了各种努力(例如FreeMatch),但尚未有方法能够使用100%的可用数据。为了克服这一限制并提升半监督学习性能,我们引入了MaskMatch,这是一种充分利用无标签数据来提升半监督学习的新算法。MaskMatch整合了一种自监督学习策略,即掩码自编码器(MAE),它使用所有可用数据来强制进行视觉表示学习。这使得半监督学习算法能够利用所有可用数据,包括那些通常被传统方法过滤掉的样本。此外,我们提出了一种合成数据训练方法,以进一步提高数据利用率和改善泛化能力。这些创新使MaskMatch在具有挑战性的数据集上取得了最先进的结果。例如,在每类2个标签的CIFAR-100、每类4个标签的STL-10和每类2个标签的Euro-SAT数据集上,MaskMatch分别取得了18.71%、9.47%和3.07%的低错误率。代码将公开发布。

关键词

引用

@article{arxiv.2405.06227,
  title  = {MaskMatch: Boosting Semi-Supervised Learning Through Mask Autoencoder-Driven Feature Learning},
  author = {Wenjin Zhang and Keyi Li and Sen Yang and Chenyang Gao and Wanzhao Yang and Sifan Yuan and Ivan Marsic},
  journal= {arXiv preprint arXiv:2405.06227},
  year   = {2024}
}