用于增强视觉 Mamba 自回归预训练的分隔符
计算机视觉与模式识别
2026-03-05 v1 人工智能
摘要
状态空间模型 Mamba 最近在计算机视觉领域作为一种有前景的范式而引起广泛关注,由于其高效处理长序列任务的能力。Mamba 的内在因果机制使其特别适用于自回归预训练。然而,当前的自回归预训练方法受限于短序列任务,无法充分发挥 Mamba 在处理长序列方面的优势。为此,我们引入一种创新的自回归预训练方法,用于 Vision Mamba,显著扩展输入序列长度。我们引入新的分离器 (STAR) 用于自回归预训练,以划分和区分不同图像,具体即在每个图像之前插入相同的分隔符以标记其起始。该策略使我们能够在保持原始数据集图像维度的前提下,将 Vision Mamba 的输入序列长度扩大四倍。运用这种长序列预训练技术,我们的 STAR-B 模型在 ImageNet-1k 上实现了惊人的 83.5% 准确率,这在 Vision Mamba 领域表现极具竞争力。这一结果凸显了通过更好地利用长程依赖来提升视觉模型性能的潜力。
引用
@article{arxiv.2603.03806,
title = {Separators in Enhancing Autoregressive Pretraining for Vision Mamba},
author = {Hanpeng Liu and Zidan Wang and Shuoxi Zhang and Kaiyuan Gao and Kun He},
journal= {arXiv preprint arXiv:2603.03806},
year = {2026}
}