中文

稀疏VILA:高效VLM推理的视觉稀疏性解耦

计算机视觉与模式识别 2025-10-21 v1

摘要

视觉语言模型(VLM)在整合视觉与文本推理方面取得了快速进展,为高分辨率图像理解、长视频分析和多轮对话等应用提供了动力。然而,其可扩展性受限于主导推理延迟的视觉标记数量。我们提出SparseVILA,这是一种高效VLM推理的新范式,通过在预填充和解码阶段解耦视觉稀疏性来实现。SparseVILA通过在预填充期间剪枝冗余视觉标记,在解码期间仅检索查询相关标记来分配稀疏性。这种解耦设计在保持多轮保真度方面表现出色——通过保留大部分视觉缓存,以便在每个对话轮次中检索查询感知标记。基于经过 AWQ 优化的推理管线,SparseVILA在长上下文视频任务上实现了最高可达 4.0 倍的预填充加速、2.5 倍的解码加速,以及整体 2.6 倍的端到端加速——同时在文档理解和推理任务中提升了准确率。通过解耦查询不可知剪枝和查询感知检索,SparseVILA确立了高效多模态推理的新方向,为加速大型VLM提供一种无需牺牲能力的训练免费、架构无关的框架。

关键词

引用

@article{arxiv.2510.17777,
  title  = {SparseVILA: Decoupling Visual Sparsity for Efficient VLM Inference},
  author = {Samir Khaki and Junxian Guo and Jiaming Tang and Shang Yang and Yukang Chen and Konstantinos N. Plataniotis and Yao Lu and Song Han and Zhijian Liu},
  journal= {arXiv preprint arXiv:2510.17777},
  year   = {2025}
}