具有去噪对比的掩码图像建模
计算机视觉与模式识别
2023-01-31 v2
摘要
从对比学习到掩码图像建模(MIM),自监督视觉表征学习的发展在本质上并无显著差异,即如何为视觉字典查找设计恰当的 pretext 任务。MIM 近期凭借在 vision Transformers(ViTs)上的 SOTA 性能主导了该方向研究,其核心是通过去噪自编码机制增强网络在块级别的视觉上下文捕捉能力。与以往工作额外训练阶段定制图像分词器不同,我们释放了对比学习在去噪自编码上的巨大潜力,并引入一种纯 MIM 方法 ConMIM,产生简单的图像内块间对比约束作为掩码块预测的唯一学习目标。我们进一步通过非对称设计(包括图像扰动和模型进度率)强化去噪机制,以改进网络预训练。不同规模的 ConMIM 预训练模型在下游图像分类、语义分割、目标检测和实例分割任务上取得了有竞争力的结果,例如在 ImageNet-1K 分类上,我们在无额外预训练数据的情况下用 ViT-Small 达到 83.9% top-1 准确率,用 ViT-Base 达到 85.3%。
引用
@article{arxiv.2205.09616,
title = {Masked Image Modeling with Denoising Contrast},
author = {Kun Yi and Yixiao Ge and Xiaotong Li and Shusheng Yang and Dian Li and Jianping Wu and Ying Shan and Xiaohu Qie},
journal= {arXiv preprint arXiv:2205.09616},
year = {2023}
}
备注
Accepted by ICLR 2023. The code will be available at https://github.com/TencentARC/ConMIM