中文

Adventurer:优化视觉 Mamba 架构设计的效率

计算机视觉与模式识别 2025-06-02 v2

摘要

本文介绍了 Adventurer 系列模型,其中将图像视为补丁标记的序列,并采用单向语言模型来学习视觉表征。这种建模范式允许我们以序列长度为线性复杂度的方式,对图像进行递归处理,从而有效解决高分辨率和细粒度图像所带来的内存和计算爆炸问题。具体而言,我们引入两种简单设计,以无缝将图像输入集成到因果推断框架中:一种位于序列开头的全局池化标记,以及每两层之间翻转操作。大量经验研究表明,与现有的纯架构(如 DeiT 和 Vim)相比,Adventurer 在效率与精度之间达到了最佳权衡。例如,我们的 Adventurer-Base 在标准 ImageNet-1k 基准上取得了 84.3% 的竞争性测试准确率,训练吞吐量为 216 图像/秒,实现相同结果的速度分别比 Vim 和 DeiT 快 3.8 倍和 6.2 倍。由于 Adventurer 具备极佳的计算和内存效率,并可随序列长度线性扩展,故我们希望该架构能为建模高分辨率或细粒度图像的长序列提供帮助。代码已公开于 https://github.com/wangf3014/Adventurer。

关键词

引用

@article{arxiv.2410.07599,
  title  = {Adventurer: Optimizing Vision Mamba Architecture Designs for Efficiency},
  author = {Feng Wang and Timing Yang and Yaodong Yu and Sucheng Ren and Guoyizhe Wei and Angtian Wang and Wei Shao and Yuyin Zhou and Alan Yuille and Cihang Xie},
  journal= {arXiv preprint arXiv:2410.07599},
  year   = {2025}
}

备注

Published in CVPR 2025