HIVTP:基于中层重要性得分的无训练视觉标记修剪方法
计算机视觉与模式识别
2025-10-10 v2
摘要
视觉语言模型(VLM)在 diverse 多模态任务上表现出强大的能力。然而,视觉编码器输出的大量视觉标记严重阻碍推理效率,而 prior 研究表明,这些标记中许多并不重要,因此可以安全地被修剪。本文提出了 HIVTP,一种基于中层重要性得分进行层次化视觉标记修剪的无训练方法。具体而言,我们利用来自视觉编码器中间层的注意力图,这些图更能反映细粒度和对象级别的注意力,以估计视觉标记的重要性。基于此,我们提出了一种层次化视觉标记修剪方法,以保留全局和局部都重要的视觉标记。具体做法是将视觉编码器输出的 1 维视觉标记序列重塑为 2 维空间布局。在全局保留阶段,我们将图像划分为区域,并保留每个区域内重要性得分更高的标记;在局部保留阶段,我们进一步将图像划分为小窗口,并保留每个局部窗口中最重要的标记。实验结果表明,我们提出的 HIVTP 方法可在 LLaVA-v1.5-7B 和 LLaVA-Next-7B 的首个标记到达时间(TTFT)分别降低最高可达 50.0% 和 55.1%,并提升标记生成吞吐量最高可达 60.9% 和 47.3%,且不牺牲准确性,甚至在某些基准测试中实现准确性提升。与 prior 工作相比,HIVTP 在准确性方面表现更好,同时提供更高的推理效率。
引用
@article{arxiv.2509.23663,
title = {HIVTP: A Training-Free Method to Improve VLMs Efficiency via Hierarchical Visual Token Pruning Using Middle-Layer-Based Importance Score},
author = {Jingqi Xu and Jingxi Lu and Chenghao Li and Sreetama Sarkar and Peter A. Beerel},
journal= {arXiv preprint arXiv:2509.23663},
year = {2025}
}