中文

揭示掩码图像建模的暗秘密

计算机视觉与模式识别 2022-05-30 v2 人工智能 机器学习

摘要

掩码图像建模(MIM)作为预训练已被证明对众多视觉下游任务有效,但MIM如何以及在何处起作用仍不清楚。在本文中,我们从可视化和实验两个角度将MIM与长期主导的监督预训练模型进行比较,以揭示它们关键的代表性差异。从可视化中,我们发现MIM为训练模型的所有层带来了局部性归纳偏置,而监督模型倾向于在较低层局部关注、在较高层更全局关注。这可能是MIM有助于具有非常大感受野的Vision Transformer进行优化的原因。使用MIM,模型能在所有层上保持注意力头的大多样性。但对于监督模型,注意力头的多样性在最后三层几乎消失,且多样性降低损害了微调性能。从实验中,我们发现MIM模型在弱语义的几何与运动任务或细粒度分类任务上显著优于其监督对应模型。无需额外技巧,标准的MIM预训练SwinV2-L可在姿态估计(COCO test-dev上78.9 AP,CrowdPose上78.0 AP)、深度估计(NYUv2上0.287 RMSE,KITTI上1.966 RMSE)和视频目标跟踪(LaSOT上70.7 SUC)上达到最先进性能。对于类别被监督预训练充分覆盖的语义理解数据集,MIM模型仍能取得极具竞争力的迁移性能。通过对MIM的更深入理解,我们希望我们的工作能启发该方向上新颖而扎实的研究。

关键词

引用

@article{arxiv.2205.13543,
  title  = {Revealing the Dark Secrets of Masked Image Modeling},
  author = {Zhenda Xie and Zigang Geng and Jingcheng Hu and Zheng Zhang and Han Hu and Yue Cao},
  journal= {arXiv preprint arXiv:2205.13543},
  year   = {2022}
}