中文

半监督掩码自编码器:在有限数据下释放视觉Transformer的潜力

计算机视觉与模式识别 2026-01-29 v1 人工智能 机器学习

摘要

我们解决了当标记数据稀缺但未标记数据丰富时训练视觉Transformer(ViT)的挑战。我们提出了半监督掩码自编码器(SSMAE),这是一个通过使用未标记和标记样本以及动态选择的伪标签来联合优化掩码图像重建和分类的框架。SSMAE引入了一种验证驱动的门控机制,该机制仅在模型对同一图像的弱增强和强增强视图都产生可靠、高置信度且一致的预测后才激活伪标签,从而减少了确认偏差。在CIFAR-10和CIFAR-100上,SSMAE始终优于有监督的ViT和微调的MAE,在低标签率设置下提升最大(在CIFAR-10上使用10%标签时比ViT提升+9.24%)。我们的结果表明,对于数据高效的Transformer训练,引入伪标签的时机与其生成方式同样重要。代码可在 https://github.com/atik666/ssmae 获取。

关键词

引用

@article{arxiv.2601.20072,
  title  = {Semi-Supervised Masked Autoencoders: Unlocking Vision Transformer Potential with Limited Data},
  author = {Atik Faysal and Mohammad Rostami and Reihaneh Gh. Roshan and Nikhil Muralidhar and Huaxia Wang},
  journal= {arXiv preprint arXiv:2601.20072},
  year   = {2026}
}