中文

注视你所见:无需重建的掩码图像建模

计算机视觉与模式识别 2023-03-17 v2

摘要

掩码自编码器(MAE)已成为大规模视觉表征预训练的主流范式。通过从一小部分可见图像区域重建被掩码的图像块,MAE 迫使模型推断图像内的语义关联。近来,一些方法应用语义丰富的教师模型提取图像特征作为重建目标,取得了更优性能。然而,与像素值等低级特征不同,我们认为强大教师模型提取的特征已在完整图像中编码了跨区域的丰富语义关联。这引出一个问题:在使用教师模型的掩码图像建模(MIM)中,重建是否必要?本文提出一种高效的 MIM 范式 MaskAlign。MaskAlign 简单地学习学生模型提取的可见块特征与教师模型提取的完整图像特征之间的一致性。为进一步提升性能并解决学生与教师模型间输入不一致的问题,我们提出动态对齐(DA)模块以施加可学习的对齐。实验结果表明,即便不对掩码区域进行重建,掩码建模仍不失其有效性。结合动态对齐,MaskAlign 能以更高效率达到最先进的性能。代码与模型将发布于 https://github.com/OpenPerceptionX/maskalign。

关键词

引用

@article{arxiv.2211.08887,
  title  = {Stare at What You See: Masked Image Modeling without Reconstruction},
  author = {Hongwei Xue and Peng Gao and Hongyang Li and Yu Qiao and Hao Sun and Houqiang Li and Jiebo Luo},
  journal= {arXiv preprint arXiv:2211.08887},
  year   = {2023}
}

备注

Accepted by CVPR 2023