中文

FastMIM:加速视觉掩码图像建模预训练

计算机视觉与模式识别 2022-12-14 v1

摘要

Transformer 与掩码图像建模(MIM)预训练框架的结合已在各种视觉任务中展现出巨大潜力。然而,预训练的计算开销过于沉重,阻碍了 MIM 成为一种实用的训练范式。本文提出 FastMIM,一个简单且通用的加速掩码图像建模的框架,包含以下两步:(i) 使用低分辨率输入图像预训练视觉骨干网络;(ii) 重建方向梯度直方图(HOG)特征而非输入图像的原始 RGB 值。此外,我们提出 FastMIM-P,在预训练阶段逐步增大输入分辨率,以进一步增强高容量模型的迁移效果。我们指出:(i) 预训练阶段大范围的输入分辨率在微调阶段及检测、分割等下游任务中可带来相似性能;(ii) 编码器的浅层在预训练中更为重要,丢弃最后若干层可加速训练阶段且不影响微调性能;(iii) 解码器应与所选网络规模匹配;(iv) 在分辨率迁移时 HOG 比 RGB 值更稳定。借助 FastMIM,各类视觉骨干网络均可高效预训练。例如,以 ViT-B/Swin-B 为骨干网络,我们可在 ImageNet-1K 上达到 83.8%/84.1% 的 top-1 准确率。相较以往相关方法,我们能在取得相当或更高 top-1 准确率的同时将训练过程加速约 5 倍。代码见 https://github.com/ggjy/FastMIM.pytorch。

关键词

引用

@article{arxiv.2212.06593,
  title  = {FastMIM: Expediting Masked Image Modeling Pre-training for Vision},
  author = {Jianyuan Guo and Kai Han and Han Wu and Yehui Tang and Yunhe Wang and Chang Xu},
  journal= {arXiv preprint arXiv:2212.06593},
  year   = {2022}
}

备注

Tech report