中文

利用 Mamba 进行自回归预训练的视觉模型

计算机视觉与模式识别 2024-06-12 v1

摘要

视觉社区已开始利用最近发展出的状态空间模型 Mamba 作为各种任务的新型 backbone。本文表明,通过自回归预训练可以显著增强 Mamba 的视觉能力,这一方向此前未被探索。就效率而言,自回归方式能够充分利用 Mamba 的单向循环结构,实现比掩码建模等其他训练策略更快的整体训练速度。就性能而言,自回归预训练为 Mamba 架构提供了显著更高的准确率,其超出了受监督训练的对手;更重要的是,成功地将其扩展潜力释放给大型乃至巨型模型。例如,经过自回归预训练后,一个 base 大小的 Mamba 达到 83.2% 的 ImageNet 准确率,超越其受监督对手 2.0%;我们的巨型 Mamba——目前最大的视觉 Mamba——达到 85.0% 的 ImageNet 准确率(在 384×384384\times384 输入下微调可达 85.5%),显著超越了视觉领域的所有其他 Mamba 变体。代码已发布于 \url{https://github.com/OliverRensu/ARM}。

关键词

引用

@article{arxiv.2406.07537,
  title  = {Autoregressive Pretraining with Mamba in Vision},
  author = {Sucheng Ren and Xianhang Li and Haoqin Tu and Feng Wang and Fangxun Shu and Lei Zhang and Jieru Mei and Linjie Yang and Peng Wang and Heng Wang and Alan Yuille and Cihang Xie},
  journal= {arXiv preprint arXiv:2406.07537},
  year   = {2024}
}