中文

PixMIM:重新思考掩码图像建模中的像素重建

计算机视觉与模式识别 2023-03-27 v2

摘要

随着掩码自编码器(MAE)与 BEiT 的出现,掩码图像建模(MIM)取得了可喜进展。然而,后续工作通过引入新辅助任务或额外预训练模型使框架复杂化,不可避免地增加了计算开销。本文从像素重建视角对 MIM 进行基础性分析,考察输入图像块与重建目标,并指出两个关键但此前被忽视的瓶颈。基于此分析,我们提出一种极为简单有效的方法 PixMIM,包含两种策略:1)从重建目标中滤除高频分量,以降低网络对纹理丰富细节的关注;2)采用保守的数据变换策略,缓解 MIM 训练中的前景缺失问题。PixMIM 可轻松集成至多数现有基于像素的 MIM 方法(即使用原始图像作为重建目标)中,且几乎不增加额外计算。无需额外技巧,我们的方法在各类下游任务上持续提升 MAE、ConvMAE 与 LSMAE 三种 MIM 方法的性能。我们相信这一有效的即插即用方法将作为自监督学习的强基线,并为未来 MIM 框架的改进提供见解。代码与模型见 \url{https://github.com/open-mmlab/mmselfsup/tree/dev-1.x/configs/selfsup/pixmim}。

关键词

引用

@article{arxiv.2303.02416,
  title  = {PixMIM: Rethinking Pixel Reconstruction in Masked Image Modeling},
  author = {Yuan Liu and Songyang Zhang and Jiacheng Chen and Kai Chen and Dahua Lin},
  journal= {arXiv preprint arXiv:2303.02416},
  year   = {2023}
}

备注

Update code link and add additional results