中文

ML-Mamba:基于 Mamba-2 的高效多模态大语言模型

计算机视觉与模式识别 2024-08-22 v3 人工智能 计算与语言

摘要

多模态大语言模型(MLLM)因其多功能性而受到广泛关注。然而,传统的 Transformer 架构因其二次计算复杂度而产生显著开销。为此,本文引入 ML-Mamba,一种多模态语言模型,采用最新且高效的 Mamba-2 模型进行推理。Mamba-2 因其线性可扩展性和快速处理长序列而著称。我们将基于 Transformer 的主干网络替换为预训练的 Mamba-2 模型,并探索将 2D 视觉选择扫描机制集成到多模态学习中的方法,同时尝试各种视觉编码器和 Mamba-2 模型变体。我们在各种多模态基准测试中的大量实验表明,ML-Mamba 的性能与当前方法相当,突显了状态空间模型在多模态任务中的潜力。实验结果表明:(1)我们经验性地探索了如何有效地将 2D 视觉选择扫描机制应用于多模态学习,我们提出一种新颖的多模态连接器称为 Mamba-2 Scan Connector(MSC),增强了表征能力。(2)ML-Mamba 通过线性序列建模,在推理速度上优于如 TinyLaVA 和 MobileVLM v2 等最先进方法。(3)与基于 Mamba-1 的多模态模型相比,基于 Mamba-2 的 ML-Mamba 在推理性能和效果方面表现更优。

关键词

引用

@article{arxiv.2407.19832,
  title  = {ML-Mamba: Efficient Multi-Modal Large Language Model Utilizing Mamba-2},
  author = {Wenjun Huang and Jiakai Pan and Jiahao Tang and Yanyu Ding and Yifei Xing and Yuhe Wang and Zhengzhuo Wang and Jianguo Hu},
  journal= {arXiv preprint arXiv:2407.19832},
  year   = {2024}
}