中文

SimMIM:一种用于掩码图像建模的简单框架

计算机视觉与模式识别 2022-04-19 v2

摘要

本文提出 SimMIM,一种用于掩码图像建模的简单框架。我们简化了近期提出的相关方法,无需诸如块级掩码以及通过离散 VAE 或聚类的分词等特殊设计。为研究是什么使掩码图像建模任务学到良好表征,我们系统研究了框架中的主要组件,发现各组件的简单设计即展现出极强的表征学习性能:1)以适中较大的掩码块尺寸(如 32)对输入图像进行随机掩码,构成强预文本任务;2)通过直接回归预测 RGB 原始像素值,性能不逊于具有复杂设计的块分类方法;3)预测头可轻量至线性层,性能不逊于更重的头部。使用 ViT-B,我们的方法在 ImageNet-1K 上仅用该数据集预训练即取得 83.8% 的 top-1 微调准确率,超越先前最佳方法 +0.6%。当应用于约 6.5 亿参数的更大模型 SwinV2-H 时,仅用 ImageNet-1K 数据即在 ImageNet-1K 上取得 87.1% 的 top-1 准确率。我们还借助该方法辅助训练 3B 模型(SwinV2-G),相比先前实践仅用 1/40 的数据,即在四项代表性视觉基准上取得最先进性能。代码与模型将公开于 https://github.com/microsoft/SimMIM。

关键词

引用

@article{arxiv.2111.09886,
  title  = {SimMIM: A Simple Framework for Masked Image Modeling},
  author = {Zhenda Xie and Zheng Zhang and Yue Cao and Yutong Lin and Jianmin Bao and Zhuliang Yao and Qi Dai and Han Hu},
  journal= {arXiv preprint arXiv:2111.09886},
  year   = {2022}
}