VL-Mamba:探索状态空间模型用于多模态学习
计算机视觉与模式识别
2024-03-21 v1
摘要
多模态大语言模型 (MLLMs) 已引起广泛关注并具有丰富的应用。然而,其 Transformer 结构中固有的注意力机制需要二次复杂度,导致计算开销高昂。因此,在本工作中,我们提出了 VL-Mamba,一种基于状态空间模型的多模态大语言模型,该模型已被证明在长序列建模方面具有巨大潜力,具有快速推理和序列长度线性缩放的特点。具体来说,我们首先将基于 Transformer 的主干语言模型(如 LLama 或 Vicuna)替换为预训练的 Mamba 语言模型。然后,我们通过实验探索了如何有效地将 2D 视觉选择性扫描机制应用于多模态学习,以及不同视觉编码器与预训练 Mamba 语言模型变体的组合。在多种多模态基准上的大量实验及其具有竞争力的性能,表明了所提出的 VL-Mamba 的有效性,并展示了将状态空间模型应用于多模态学习任务的巨大潜力。
引用
@article{arxiv.2403.13600,
title = {VL-Mamba: Exploring State Space Models for Multimodal Learning},
author = {Yanyuan Qiao and Zheng Yu and Longteng Guo and Sihan Chen and Zijia Zhao and Mingzhen Sun and Qi Wu and Jing Liu},
journal= {arXiv preprint arXiv:2403.13600},
year = {2024}
}