中文

掩码图像建模自监督表示学习的改进

计算机视觉与模式识别 2022-05-24 v1

摘要

本文探讨了掩码图像建模 (MIM) 范式的改进。MIM 范式通过掩码输入图像并由未掩码部分预测掩码部分,使模型学习图像的主要物体特征。我们发现了 MIM 可改进的以下三个主要方向。首先,由于编码器和解码器都对表示学习有贡献,MIM 仅将编码器用于下游任务,忽略了解码器对表示学习的影响。尽管 MIM 范式已采用具有非对称结构的小型解码器,我们认为继续减少解码器参数有利于提升编码器的表示学习能力。其次,MIM 通过共同训练编码器和解码器来解决图像预测任务,并未为编码器设计独立任务。为了进一步增强编码器在执行下游任务时的性能,我们为编码器设计了对比学习和 token 位置预测任务。第三,由于输入图像可能包含背景及其他物体,且各物体在图像中占比不同,重建与背景或其他物体相关的 token 对 MIM 理解主要物体表示并无意义。因此我们使用 ContrastiveCrop 裁剪输入图像,使其尽可能仅包含主要物体。基于上述对 MIM 的三点改进,我们提出了一种新模型——对比掩码自编码器 (CMAE)。我们在 tinyimagenet 上使用 ViT-B 骨干网络取得了 65.84% 的 Top-1 准确率,在同等条件下比竞争方法 MAE 高出 2.89%。代码将公开。

关键词

引用

@article{arxiv.2205.10546,
  title  = {Improvements to Self-Supervised Representation Learning for Masked Image Modeling},
  author = {Jiawei Mao and Xuesong Yin and Yuanqi Chang and Honggu Zhou},
  journal= {arXiv preprint arXiv:2205.10546},
  year   = {2022}
}