中文

MAP:基于掩码自回归预训练释放混合 Mamba-Transformer 视觉骨干网络潜能

计算机视觉与模式识别 2025-05-26 v3 人工智能

摘要

混合 Mamba-Transformer 网络最近引起广泛关注。这些网络能够利用 Transformer 的可扩展性,同时发挥 Mamba 在长序列建模和计算效率方面的优势。然而,有效地为此类混合网络进行预训练仍是一个尚未解决的问题。现有方法,如掩码自编码器(MAE)或自回归(AR)预训练,主要侧重于单一类型网络架构。相反,针对混合架构的预训练策略必须同时对 Mamba 和 Transformer 组件有效。基于此,我们提出了掩码自回归预训练(MAP)策略,用于预训练混合 Mamba-Transformer 视觉骨干网络。该策略结合了 MAE 和自回归预训练的优势,在统一的范式中提高了 Mamba 和 Transformer 模块的性能。实验结果表明,采用 MAP 预训练的混合 Mamba-Transformer 视觉骨干网络在各种预训练策略上均显著优于其他方法,实现了最先进的性能。我们在 2D 和 3D 数据集上验证了该方法的有效性,并提供了详细的消融研究,以支持每个组件的设计选择。代码和模型权重均可在 https://github.com/yunzeliu/MAP 获取。

关键词

引用

@article{arxiv.2410.00871,
  title  = {MAP: Unleashing Hybrid Mamba-Transformer Vision Backbone's Potential with Masked Autoregressive Pretraining},
  author = {Yunze Liu and Li Yi},
  journal= {arXiv preprint arXiv:2410.00871},
  year   = {2025}
}