VISion On Request:提升稀疏、动态选择视觉语言交互以增强 VLLM 效率
计算机视觉与模式识别
2026-03-25 v1 人工智能
机器学习
摘要
现有提高大型视觉语言模型(LVLMs)效率的方法主要基于视觉标记减少的概念。然而,这种方法会制造信息瓶颈,尤其在需要细粒度理解和推理的挑战性任务中会损害性能。本文通过引入 VISion On Request(VISOR)来挑战这一范式,该方法在不丢弃视觉信息的前提下降低推理成本。具体而言,VISOR 通过稀疏化图像和文本标记之间的交互来提高效率。具体做法是:语言模型通过少量战略性放置的注意力层即可注意于完整的高分辨率视觉标记:通过高效的文本-图像交叉注意力提供一般视觉上下文,而少数恰当放置且动态选择的自注意力层则细化视觉表征,从而在必要时实现复杂的高分辨率推理。基于这一原则,我们首先在不同计算预算下训练单个通用网络(通过变化自注意力层的数量),随后引入轻量级策略机制,基于每个样本的复杂度动态分配视觉计算资源。大量实验表明,VISOR 在多样化基准测试中显著降低计算成本,同时匹配或超越最新成果,尤其在需要细致视觉理解的挑战性任务中表现突出。
引用
@article{arxiv.2603.23495,
title = {VISion On Request: Enhanced VLLM efficiency with sparse, dynamically selected, vision-language interactions},
author = {Adrian Bulat and Alberto Baldrati and Ioannis Maniadis Metaxas and Yassine Ouali and Georgios Tzimiropoulos},
journal= {arXiv preprint arXiv:2603.23495},
year = {2026}
}
备注
Accepted at CVPR 2026