中文

聚焦-上下文:面向视觉语言模型的主体中心化渐进式视觉标记减少

计算机视觉与模式识别 2026-05-21 v1 人工智能

摘要

视觉语言模型 (VLM) 在推理期间因大量视觉标记序列而面临计算成本瓶颈。现有视觉标记减少方法虽缓解了这一负担,但意外地保留了严格对应用户查询的孤立视觉主体,未能显著探索显著主体及其上下文关系。本文提出 SPpruner,一种主体中心化的渐进式减少范式,模拟人类视觉感知系统的 "聚焦-上下文" 机制。具体而言,我们首先构建聚焦识别模块,显式建模视觉显著性与语义相关性之间的相互作用。该模块可挖掘完整的视觉主体谱系,确保视觉输入的高保真表示。随后,开发基于上下文的结构扫描模块,以聚合邻近区域的上下文线索。如此,可有效恢复全局关系依赖,维持所保留主体的结构完整性。大量实验表明,我们的范式在一致性上优于 SOTA 方法,在 Qwen2.5-VL 上实现最高提速 2.53 倍,仅保留 22.2% 的视觉标记;在 LLaVA 上实现 67% 的 FLOPs 降低,仅有 0.6% 的准确率下降。

关键词

引用

@article{arxiv.2605.20950,
  title  = {Focus-then-Context: Subject-Centric Progressive Visual Token Reduction for Vision-Language Models},
  author = {Yulin Zhao and Yun Wang and Dehua Zheng and Borui jiang and Zheng Zhang},
  journal= {arXiv preprint arXiv:2605.20950},
  year   = {2026}
}