相似性感知的 Token 剪枝:更快的 VLM
计算机视觉与模式识别
2025-03-17 v1
摘要
由于自注意力的二次复杂度,Vision Transformer (ViT) 和视觉语言模型 (VLM) 的计算需求仍然是一个重大挑战。虽然 Token 剪枝提供了一个有前景的解决方案,但现有方法通常会引入训练开销或无法跨层动态适应。我们提出了 SAINT,一个无需训练的 Token 剪枝框架,它利用 Token 相似性和基于图的公式来动态优化剪枝率和冗余阈值。通过系统分析,我们在 Transformer 中发现了一个普遍的三阶段 Token 演化过程(aligner-explorer-aggregator),能够在不牺牲关键信息的情况下在早期阶段进行激进剪枝。对于 ViT,SAINT 在 224px 分辨率下将 ViT-H/14 的吞吐量提高了一倍,在 ImageNet-1K 上仅有 0.6% 的精度损失,超过最接近的竞争者 0.8%。对于 VLM,我们以三种模式应用 SAINT:仅 ViT、仅 LLM 和混合模式。SAINT 将 LLaVA-13B 的 Token 减少 75%,在各基准测试中性能损失不到 1% 的情况下,实现了与 LLaVA-7B 相当的延迟。我们的工作为 ViT 和 VLM 的高效推理建立了一个统一、实用的框架。
引用
@article{arxiv.2503.11549,
title = {Similarity-Aware Token Pruning: Your VLM but Faster},
author = {Ahmadreza Jeddi and Negin Baghbanzadeh and Elham Dolatabadi and Babak Taati},
journal= {arXiv preprint arXiv:2503.11549},
year = {2025}
}
备注
15 pages, 8 figures, 8 tables