中文

VLMs是否需要Vision Transformers?评估State Space Models作为视觉编码器

计算机视觉与模式识别 2026-03-20 v1 机器学习

摘要

大型视觉-语言模型(VLMs)常使用冻结的视觉 backbone,其图像特征通过轻量级连接器映射到大语言模型。虽然基于Transformer的编码器是标准的视觉 backbone,但我们探讨了基于状态空间模型(SSM)的视觉 backbone是否是强有力的替代方案。我们在受控环境中系统评估了SSM视觉 backbone用于VLMs。在匹配的ImageNet-1K初始化下,SSM backbone在VQA和grounding/localization任务中实现最强的整体性能。我们进一步适配SSM和ViT系列 backbone进行检测或分割训练,发现稠密任务调谋普遍提升两个系列的性能;在此适配后,SSM backbone虽在模型规模上显著较小,却仍具竞争力。我们进一步观察到:(i)更高的ImageNet准确率或更大的backbone不一定可靠地转化为更好的VLM性能,(ii)某些视觉backbone在 localisation 中不稳定。基于这些发现,我们提出稳定性策略,显著改善两个backbone系列的鲁棒性,并指出SSM backbone是视觉编码器在VLMs中强有力的Transformer替代方案。

关键词

引用

@article{arxiv.2603.19209,
  title  = {Do VLMs Need Vision Transformers? Evaluating State Space Models as Vision Encoders},
  author = {Shang-Jui Ray Kuo and Paola Cascante-Bonilla},
  journal= {arXiv preprint arXiv:2603.19209},
  year   = {2026}
}

备注

Project page: https://lab-spell.github.io/vlm-ssm-vision-encoders/ ; Code: https://github.com/raykuo18/vlm-ssm-vision-encoders