Multimodal Mamba:通过二次到线性蒸馏的仅解码器多模态状态空间模型
计算机视觉与模式识别
2025-03-19 v2
摘要
近期的多模态大语言模型(MLLMs)取得了显著的性能,但由于其二次计算复杂度、不断增长的 Key-Value 缓存需求以及对独立视觉编码器的依赖,面临部署挑战。我们提出 mmMamba,一个利用中等学术计算资源通过从现有 MLLMs 渐进蒸馏来开发线性复杂度原生多模态状态空间模型的框架。我们的方法能够将训练好的仅解码器 MLLMs 直接转换为线性复杂度架构,无需预训练的基于 RNN 的 LLM 或视觉编码器。我们提出了一种从训练好的 Transformer 中雕刻出 Mamba 的种子策略,以及一个三阶段蒸馏方案,能够有效将知识从 Transformer 转移到 Mamba,同时保留多模态能力。我们的方法还支持结合 Transformer 和 Mamba 层的灵活混合架构,以实现可定制的效率与性能权衡。从基于 Transformer 的仅解码器 HoVLE 蒸馏而来,mmMamba-linear 实现了与现有线性和二次复杂度 VLMs 相当的性能,而 mmMamba-hybrid 进一步显著提升了性能,接近 HoVLE 的能力。在 103K tokens 时,mmMamba-linear 相比 HoVLE 实现了 20.6 的加速和 75.8% 的 GPU 内存减少,而 mmMamba-hybrid 实现了 13.5 的加速和 60.2% 的内存节省。代码和模型已发布于 https://github.com/hustvl/mmMamba
引用
@article{arxiv.2502.13145,
title = {Multimodal Mamba: Decoder-only Multimodal State Space Model via Quadratic to Linear Distillation},
author = {Bencheng Liao and Hongyuan Tao and Qian Zhang and Tianheng Cheng and Yingyue Li and Haoran Yin and Wenyu Liu and Xinggang Wang},
journal= {arXiv preprint arXiv:2502.13145},
year = {2025}
}
备注
Code and model are available at https://github.com/hustvl/mmMamba