平稳加速:重新审视视觉语言模型加速中的视觉 Token 剪枝
计算机视觉与模式识别
2025-08-04 v2
摘要
近期关于加速视觉语言模型的工作尽管对视觉信息进行了高度压缩,但在各种视觉语言任务上仍取得了强劲的性能。在本工作中,我们研究了在语言模型内部对视觉 token 进行早期剪枝这一流行的加速方法。令人惊讶的是,我们发现尽管在许多任务上保持了强劲的性能,但对于定位等以视觉为中心的子集任务,它表现出截然不同的行为。经过进一步调查,我们发现了该加速方法的一个核心问题:图像顶部的大部分 token 都被剪枝掉了。然而,在许多旨在评估以视觉为中心能力的基准测试上,这种有缺陷的剪枝策略依然保持了强劲的性能,这凸显了这些基准测试在评估细粒度视觉能力方面的局限性。基于这些发现,我们提出了 FEATHER(基于集成标准的快速有效加速),这是一种简单直接的方法,解决了所发现的早期层剪枝问题,并通过带有早期均匀采样的多阶段剪枝进一步增强了相关 token 的保留,以确保广泛的图像覆盖。在具有可比的计算节省下,我们发现与原始加速方法相比,FEATHER 在以视觉为中心的定位基准测试上取得了超过 5 倍的性能提升。
引用
@article{arxiv.2412.13180,
title = {Feather the Throttle: Revisiting Visual Token Pruning for Vision-Language Model Acceleration},
author = {Mark Endo and Xiaohan Wang and Serena Yeung-Levy},
journal= {arXiv preprint arXiv:2412.13180},
year = {2025}
}
备注
ICCV 2025, project page: https://web.stanford.edu/~markendo/projects/feather