颠覆 VLMs:比较 Transformer 与结构化状态空间模型在视觉与语言建模中的表现
计算机视觉与模式识别
2024-10-02 v2 人工智能
机器学习
摘要
本研究探索用 Mamba(一种近期提出在序列建模中展现出良好性能的结构化状态空间模型 (SSM))替代视觉语言模型 (VLMs) 中的 Transformer。我们在受控条件下测试了参数量高达 3B 的模型,结果表明基于 Mamba 的 VLMs 在图像描述、问答和阅读理解方面优于基于 Transformer 的 VLMs。然而,我们发现 Transformer 在视觉定位方面取得了更高的性能,且性能差距随规模扩大而增加。我们探讨了两种解释这一现象的假设:1) 任务无关视觉编码对隐藏状态更新的影响,以及 2) 从上下文多模态检索角度进行视觉定位的难度。我们的结果表明,任务感知编码对定位的性能提升微乎其微,然而在上下文多模态检索方面,Transformer 显著优于 Mamba。总体而言,Mamba 在正确输出依赖于图像摘要的任务上表现出良好的性能,但在需要从上下文中检索显式信息时则表现不佳。
引用
@article{arxiv.2409.05395,
title = {Shaking Up VLMs: Comparing Transformers and Structured State Space Models for Vision & Language Modeling},
author = {Georgios Pantazopoulos and Malvina Nikandrou and Alessandro Suglia and Oliver Lemon and Arash Eshghi},
journal= {arXiv preprint arXiv:2409.05395},
year = {2024}
}