Viper-F1:基于跨模态状态空间调制的快速精细多模态理解
计算机视觉与模式识别
2025-11-26 v3
摘要
近期多模态大语言模型(MLLM)的进展使我们在视觉语言理解方面取得了令人瞩目的成果,但其高计算成本限制了在资源受限场景(如机器人操作、个人助理和智能摄像头)中的部署。大多数现有方法依赖基于 Transformer 的交叉注意力,其二次复杂度阻碍了效率。此外,小型视觉语言模型往往难以精确捕获与任务相关的细粒度视觉区域,导致在需要细粒度推理的任务上表现下降,限制了其在实际世界中的有效性。为此,我们引入 Viper-F1,一种混合状态空间视觉语言模型,用有效的液态状态空间动力学取代注意力机制。为进一步增强视觉定位,我们提出了 Token-Grid 相关模块,计算文本标记与图像块之间的轻量级相关性,并通过 FiLM 条件化调制状态空间动力学。这使模型能够在保持线性推理时间的同时,选择性地强调与文本提示相关的视觉区域。多个基准测试的实验结果表明,Viper-F1 在显著提升效率的同时,实现了准确、细粒度的理解。
引用
@article{arxiv.2511.11177,
title = {Viper-F1: Fast and Fine-Grained Multimodal Understanding with Cross-Modal State-Space Modulation},
author = {Quoc-Huy Trinh},
journal= {arXiv preprint arXiv:2511.11177},
year = {2025}
}
备注
arXiv admin comment: This version has been removed by arXiv administrators as the submitter did not have the rights to agree to the license at the time of submission