中文

Semi-MAE:面向半监督视觉 Transformer 的掩码自编码器

计算机视觉与模式识别 2023-01-05 v1

摘要

视觉 Transformer(ViT)在半监督学习(SSL)中受限于数据稀缺。为缓解该问题,受作为数据高效自监督学习器的掩码自编码器(MAE)启发,我们提出 Semi-MAE,一种纯基于 ViT 的 SSL 框架,其包含并行 MAE 分支以辅助视觉表征学习并使伪标签更准确。MAE 分支被设计为非对称架构,由轻量解码器和权重共享编码器组成。我们将高掩码比的弱增强无标签数据输入 MAE 分支并重建缺失像素。Semi-MAE 在 ImageNet 上使用 10% 标签取得 75.9% 的 top-1 准确率,超越了先前半监督图像分类的最优性能。此外,大量实验表明 Semi-MAE 可便捷地用于其他 ViT 模型及掩码图像建模方法。

关键词

引用

@article{arxiv.2301.01431,
  title  = {Semi-MAE: Masked Autoencoders for Semi-supervised Vision Transformers},
  author = {Haojie Yu and Kang Zhao and Xiaoming Xu},
  journal= {arXiv preprint arXiv:2301.01431},
  year   = {2023}
}