别再追逐「标记 token」:重新审视视觉整体上下文保留
计算机视觉与模式识别
2025-10-13 v2
摘要
尽管多模态大语言模型(MLLMs)具备强大的能力,但因依赖大量视觉 token,其计算开销仍相当可观。近期研究探索了 token 剪枝以缓解此问题,通常基于文本-视觉跨注意力或 [\texttt{CLS}] 注意力来评估并丢弃冗余视觉 token。本文我们识别到此类以注意力为先的剪枝方法的一个关键局限,即倾向于保留语义相似的 token,导致在高剪枝比例下出现显著性能下降。为此,我们提出了 {HoloV},一个简单且有效的、即插即用的视觉 token 剪枝框架,用以高效推理。与以往的注意力优先方案不同,HoloV 从整体视角重新思考 token 保留问题。通过在不同空间 crop 之间自适应分配剪枝预算,HoloV 确保保留的 token 捕获全局视觉上下文,而非孤立的显著特征。该策略最小化了表征塌陷,甚至在激进剪枝下也能保持任务相关信息。实验结果表明,我们的 HoloV 在各种任务、MLLM 架构和剪枝比例上均优于 SOTA 方法。例如,搭载 HoloV 的 LLaVA1.5 在剪枝 88.9% 的视觉 token 后,仍保留原性能的 95.8%,实现了卓越的效率-精度权衡。
引用
@article{arxiv.2510.02912,
title = {Don't Just Chase "Highlighted Tokens" in MLLMs: Revisiting Visual Holistic Context Retention},
author = {Xin Zou and Di Lu and Yizhou Wang and Yibo Yan and Yuanhuiyi Lyu and Xu Zheng and Linfeng Zhang and Xuming Hu},
journal= {arXiv preprint arXiv:2510.02912},
year = {2025}
}
备注
Accepted by NeurIPS 2025 main