中文

用于视觉-语言模型中保守令牌凝聚的谱热流

计算机视觉与模式识别 2026-07-12 v1

摘要

视觉-语言模型(VLM)在推理时成本高昂,因为它们必须处理长序列的视觉令牌。现有的令牌剪枝方法在高压缩下往往会因盲目丢弃信息、破坏空间结构或使多样性崩溃而性能下降。我们提出了SpecFlow,一个无需训练的框架,将范式从破坏性剪枝转变为保守凝聚,严格强制空间覆盖和统计守恒以确保稳定性。将视觉令牌视为kkNN图中的节点,SpecFlow (i) 通过谱热流计算稳定的重要性场以保持结构连贯性,(ii) 通过自适应空间划分分配预算以保证覆盖,(iii) 将丢弃的信息聚合到核心集汇中以维持统计守恒。该方法是即插即用的,无需微调,并且与FlashAttention兼容。实验证实,我们的SpecFlow在任务、VLM架构和剪枝比率方面均优于SOTA方法。值得注意的是,带有SpecFlow的LLaVA-1.5在剪除88.9%的视觉令牌后仍保留了95.6%的原始性能,提供了卓越的效率-精度平衡。代码可在 https://github.com/Lzy-dot/SpecFlow 获取。

关键词

引用

@article{arxiv.2607.10640,
  title  = {Spectral Heat Flow for Conservative Token Condensation in Vision-Language Models},
  author = {Zhaoyang Li and Yanjun Li and Wangkai Li and Yujia Chen and Tianzhu Zhang},
  journal= {arXiv preprint arXiv:2607.10640},
  year   = {2026}
}

备注

Accepted by ICML 2026