CAE v2:带有 CLIP 目标的上下文自编码器
计算机视觉与模式识别
2022-11-18 v1
摘要
掩码图像建模(MIM)通过掩码和重建图像块来学习视觉表示。在 CLIP 表示上施加重建监督已被证明对 MIM 有效。然而,MIM 中 CLIP 监督如何影响性能仍未被充分探索。为研究改进以 CLIP 为目标的 MIM 的策略,我们研究了 MIM 中的两个关键要素,即监督位置和掩码率,并依托我们开发的简单流水线——带有 CLIP 目标的上下文自解码器(CAE v2)——揭示了两个有趣的视角。首先,我们观察到在可见块上的监督取得了显著性能,甚至优于在掩码块上的监督,而后者是现有 MIM 方法中的标准形式。其次,最优掩码率与模型大小正相关。也就是说,模型越小,所需掩码率越低。受这两大发现的驱动,我们简洁的方法 CAE v2 在一系列下游任务上取得了优越性能。例如,一个原始的 ViT-Large 模型在 ImageNet-1K 的线性探测和微调上分别达到 81.7% 和 86.7% 的 top-1 准确率,并且在 ADE20K 上以 300 轮预训练取得 55.9% mIoU 的语义分割结果。我们希望我们的发现能为 MIM 领域的预训练提供有益的指导,尤其是针对小规模模型。
引用
@article{arxiv.2211.09799,
title = {CAE v2: Context Autoencoder with CLIP Target},
author = {Xinyu Zhang and Jiahui Chen and Junkun Yuan and Qiang Chen and Jian Wang and Xiaodi Wang and Shumin Han and Xiaokang Chen and Jimin Pi and Kun Yao and Junyu Han and Errui Ding and Jingdong Wang},
journal= {arXiv preprint arXiv:2211.09799},
year = {2022}
}