VideoMAP:面向可扩展 Mamba 架构视频自回归预训练
计算机视觉与模式识别
2025-03-18 v1
摘要
最近的 Mamba 架构在视频理解方面表现出良好的计算效率和竞争性能,但仍面临过拟合问题,限制了其可扩展性。为克服这一挑战,我们引入了 VideoMAP,一个混合 Mamba-Transformer 框架,具有新颖的预训练方法。VideoMAP 使用 4:1 的 Mamba-to-Transformer 比例,有效平衡了计算成本和模型容量。这种架构结合我们提出的帧级遮蔽自回归预训练策略,能够在扩大模型规模时显著提升性能。此外,VideoMAP 在样本效率方面表现突出,在更少的训练数据下显著优于现有方法。实验表明,VideoMAP 在包括 Kinetics-400、Something-Something V2、Breakfast 和 COIN 在内的多个数据集上超越了现有模型。进一步,我们展示了 VideoMAP 作为多模态大语言模型视觉编码器的潜力,突出其减少内存占用并 enables 处理更长视频序列的能力。代码已开源于 https://github.com/yunzeliu/MAP
引用
@article{arxiv.2503.12332,
title = {VideoMAP: Toward Scalable Mamba-based Video Autoregressive Pretraining},
author = {Yunze Liu and Peiran Wu and Cheng Liang and Junxiao Shen and Limin Wang and Li Yi},
journal= {arXiv preprint arXiv:2503.12332},
year = {2025}
}