中文

架构无关的掩码图像建模——从 ViT 回归 CNN

计算机视觉与模式识别 2023-06-05 v4 人工智能

摘要

掩码图像建模作为一种新兴的自监督预训练方法,已借助视觉 Transformer 在众多下游视觉任务中展现出令人印象深刻的成效。其底层思想简单:将输入图像的一部分掩码掉,然后通过一个 pretext 任务重建。然而,MIM 背后的工作原理尚未被充分解释,且先前研究坚称 MIM 主要对 Transformer 家族有效而与 CNN 不兼容。在本工作中,我们观察到 MIM 本质上教模型学习更好的块间中阶交互以实现更泛化的特征提取。我们随后提出一种架构无关的掩码图像建模框架(A2^2MIM),它以统一方式兼容 Transformer 与 CNN。在流行基准上的大量实验表明,A2^2MIM 无需显式设计即可学习更好的表征,并赋予骨干模型更强的向各类下游任务迁移的能力。

关键词

引用

@article{arxiv.2205.13943,
  title  = {Architecture-Agnostic Masked Image Modeling -- From ViT back to CNN},
  author = {Siyuan Li and Di Wu and Fang Wu and Zelin Zang and Stan. Z. Li},
  journal= {arXiv preprint arXiv:2205.13943},
  year   = {2023}
}

备注

ICML 2023 (poster). The source code will be released in https://github.com/Westlake-AI/A2MIM