用于视觉-语言模型中保守令牌凝聚的谱热流
计算机视觉与模式识别
2026-07-12 v1
摘要
视觉-语言模型(VLM)在推理时成本高昂,因为它们必须处理长序列的视觉令牌。现有的令牌剪枝方法在高压缩下往往会因盲目丢弃信息、破坏空间结构或使多样性崩溃而性能下降。我们提出了SpecFlow,一个无需训练的框架,将范式从破坏性剪枝转变为保守凝聚,严格强制空间覆盖和统计守恒以确保稳定性。将视觉令牌视为NN图中的节点,SpecFlow (i) 通过谱热流计算稳定的重要性场以保持结构连贯性,(ii) 通过自适应空间划分分配预算以保证覆盖,(iii) 将丢弃的信息聚合到核心集汇中以维持统计守恒。该方法是即插即用的,无需微调,并且与FlashAttention兼容。实验证实,我们的SpecFlow在任务、VLM架构和剪枝比率方面均优于SOTA方法。值得注意的是,带有SpecFlow的LLaVA-1.5在剪除88.9%的视觉令牌后仍保留了95.6%的原始性能,提供了卓越的效率-精度平衡。代码可在 https://github.com/Lzy-dot/SpecFlow 获取。
引用
@article{arxiv.2607.10640,
title = {Spectral Heat Flow for Conservative Token Condensation in Vision-Language Models},
author = {Zhaoyang Li and Yanjun Li and Wangkai Li and Yujia Chen and Tianzhu Zhang},
journal= {arXiv preprint arXiv:2607.10640},
year = {2026}
}
备注
Accepted by ICML 2026