中文

对比掩码自编码器是更强的视觉学习器

计算机视觉与模式识别 2024-01-30 v3

摘要

掩码图像建模(MIM)已在多种视觉任务上取得令人鼓舞的结果。然而,所学表征有限的判别性表明,要成为更强的视觉学习器仍有许多工作要做。为此,我们提出对比掩码自编码器(CMAE),一种用于学习更全面且更强能力的视觉表征的新自监督预训练方法。通过新颖设计精心统一对比学习(CL)与掩码图像模型(MIM),CMAE 利用二者各自优势,学习兼具强实例判别性与局部可感知性的表征。具体而言,CMAE 由两个分支组成:在线分支为非对称编码器-解码器,动量分支为动量更新的编码器。训练期间,在线编码器从掩码图像的潜在表征重建原始图像以学习整体特征。动量编码器以完整图像为输入,通过其在线对应部分经对比学习增强特征判别性。为使 CL 与 MIM 兼容,CMAE 引入两个新组件,即用于生成合理正视图的像素偏移与用于补全对比对特征的特征解码器。得益于这些新颖设计,CMAE 相比其 MIM 对应方法有效提升了表征质量与迁移性能。CMAE 在极具竞争力的图像分类、语义分割与目标检测基准上达到了最先进性能。值得注意的是,CMAE-Base 在 ImageNet 上取得 85.3%85.3\% top-1 准确率,在 ADE20k 上取得 52.5%52.5\% mIoU,分别超越先前最佳结果 0.7%0.7\%1.8%1.8\%。源代码公开于 \url{https://github.com/ZhichengHuang/CMAE}。

关键词

引用

@article{arxiv.2207.13532,
  title  = {Contrastive Masked Autoencoders are Stronger Vision Learners},
  author = {Zhicheng Huang and Xiaojie Jin and Chengze Lu and Qibin Hou and Ming-Ming Cheng and Dongmei Fu and Xiaohui Shen and Jiashi Feng},
  journal= {arXiv preprint arXiv:2207.13532},
  year   = {2024}
}

备注

Accepted by TPAMI