面向高效视频大语言模型的感知 Sink-Token 剪枝
机器学习
2026-04-24 v1
摘要
视频大语言模型 (Video LLMs) 由于大量视觉 token 提供给 LLM,推理延迟高。为解决此问题,训练-free 的视觉 token 剪枝已作为一种降低计算成本的解决方案涌现出来;然而,这些方法主要是在多选问答 (MCQA) 基准上验证的,在这些基准上,粗糙的线索通常足以胜任。在本工作中,我们揭示了这些方法在需要精确视觉 grounding 的细粒度理解任务(如幻觉评估)上会出现显著性能崩溃。为探索这一差距,我们进行了系统性分析,确定 sink token——即吸引过度注意但在语义上不具信息性的 token——是细粒度视频理解的关键障碍。当这些 sink token 存活通过剪枝时,它们会扭曲模型的视觉证据并阻碍细粒度理解。受此启发,我们提出了感知 Sink-Token 剪枝 (SToP),这是一种简单而有效的即插即用方法,引入 sink score 来量化每个 token 充当 sink 的倾向,并将此分数应用于现有的空间和时间剪枝方法以抑制它们,从而增强视频理解。为验证 SToP 的有效性,我们将其应用于最先进的剪枝方法 (VisionZip、FastVid 和 Holitom),并在覆盖幻觉、开放式生成、组合推理和 MCQA 的多样化基准上进行评估。我们的结果表明,SToP 在即使剪枝最高可达 90% 的视觉 token 时也显著提升了性能。
引用
@article{arxiv.2604.20937,
title = {Sink-Token-Aware Pruning for Fine-Grained Video Understanding in Efficient Video LLMs},
author = {Kibum Kim and Jiwan Kim and Kyle Min and Yueqi Wang and Jinyoung Moon and Julian McAuley and Chanyoung Park},
journal= {arXiv preprint arXiv:2604.20937},
year = {2026}
}
备注
Under Review