中文

一针见木:小型 VLM 作为加速大型 VLM 的精确引导

计算机视觉与模式识别 2024-12-06 v2

摘要

视觉语言模型 (VLMs) 在各类多模态任务上展现出显著成功,但大型 VLMs 因处理大量视觉 token 面临显著效率挑战。使用部分信息(如特定层的注意力图)来评估 token 重要性并剔除不essential token 以加速大型 VLM 推理是一条有前景的途径。然而,我们的研究发现了三个关键见解:(i) 部分注意力信息不足以准确识别关键视觉 token,尤其在低 token 保留比例下表现次优;(ii) 全局注意力信息(如跨所有层聚合的注意力图)更有效地保留关键 token,在激进剔除时仍保持可比性能。然而,现有方法需要完整推理 pass 才能获取所有层的注意力图,这增加了计算负担;(iii) 来自小型 VLM 的全局注意力图与大型 VLM 的全局注意力图接近,表明存在高效替代方案。基于这些发现,我们引入一种 training-free 方法,即 Small VLM Guidance for accelerating Large VLMs (SGL)。具体做法是利用小型 VLM 的注意力图引导大型 VLM 的视觉 token 剔除。此外,我们开发了 early exiting 机制,充分利用小型 VLM 的预测结果,当必要时动态调用更大的 VLM,从而在准确率和计算量之间实现更佳权衡。广泛的在 11 个基准上的评估表明,SGL 的有效性和通用性, 在视觉 token 上实现最高 91% 的剔除比率,同时保持竞争性能。

关键词

引用

@article{arxiv.2412.03324,
  title  = {A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs},
  author = {Wangbo Zhao and Yizeng Han and Jiasheng Tang and Zhikai Li and Yibing Song and Kai Wang and Zhangyang Wang and Yang You},
  journal= {arXiv preprint arXiv:2412.03324},
  year   = {2024}
}