中文

MaTVLM:高效视觉语言模型的混合 Mamba-Transformer

计算机视觉与模式识别 2025-03-19 v2

摘要

随着循环神经网络模型复杂度线性增长的发展,Transformer的二次复杂度挑战正在被克服。值得注意的是,新兴的Mamba-2已显示出与循环模型和Transformer相当的性能,将两者的差距缩小到了最低。然而,由于顺序处理和梯度消失,循环模型难以捕获长程依赖,限制了上下文理解。这导致收敛缓慢、资源需求高以及在下游理解和复杂推理任务上表现不佳。本文提出一种混合模型MaTVLM,通过替换预训练视觉语言模型中部分Transformer解码器层中的Mamba-2层。利用注意力与Mamba-2之间的内在关系,我们使用相应的注意力权重初始化Mamba-2,以加速收敛。随后,我们采用单阶段蒸馏过程,以预训练的VLM作为教师模型将知识传递给MaTVLM,进一步提升收敛速度和性能。此外,我们研究了差分蒸馏损失在训练框架中的影响。在多个基准测试中评估MaTVLM,结果显示其在性能上与教师模型及现有VLMs保持竞争力,同时超越了基于Mamba的VLMs以及参数规模相当的模型。值得注意的是,MaTVLM的推理速度可提高最高达3.6倍,GPU内存消耗降低27.5%,且未损失性能。代码与模型已发布于http://github.com/hustvl/MaTVLM。

关键词

引用

@article{arxiv.2503.13440,
  title  = {MaTVLM: Hybrid Mamba-Transformer for Efficient Vision-Language Modeling},
  author = {Yingyue Li and Bencheng Liao and Wenyu Liu and Xinggang Wang},
  journal= {arXiv preprint arXiv:2503.13440},
  year   = {2025}
}

备注

Code and model are available at http://github.com/hustvl/MaTVLM