中文

AgilePruner:大型视觉语言模型中基于注意力与多样性的自适应视觉标记剪枝实证研究

计算机视觉与模式识别 2026-03-03 v1 机器学习

摘要

大型视觉语言模型(Large Vision-Language Models, LVLMs)采用视觉标记剪枝策略,以缓解因大量视觉标记序列而产生的巨大计算开销。虽然先前研究主要关注注意力机制或多样性机制,但对这些方法特征与局限性的深入分析仍属未探索之地。本文我们利用有效秩(effective rank, erank)作为特征多样性度量,以及注意力得分熵,来调查视觉标记处理机制,并分析每种方法的优势与不足。我们的分析揭示了两个见解:(1)我们的基于erank的定量分析表明,许多以多样性为导向的剪枝方法实际保存的特征多样性远低于预期;此外,使用CHAIR数据集分析发现,所保存的多样性与增加的幻觉频率密切相关,这与注意力机制剪枝不同。(2)我们进一步观察到,注意力机制方法在简单图像上更为有效,其中视觉证据集中;而多样性方法则更好地处理复杂图像,其中特征分布更广。基于这些实证见解,我们展示,将图像感知调整纳入现有混合剪枝策略中,能一致性地提高其性能。我们还通过一个简单的自适应剪枝机制,以最小方式实现我们的实证发现,该机制在标准基准测试以及幻觉特定评估中均实现了强大且可靠的性能。我们的项目页面可在 https://cvsp-lab.github.io/AgilePruner 查看。

关键词

引用

@article{arxiv.2603.01236,
  title  = {AgilePruner: An Empirical Study of Attention and Diversity for Adaptive Visual Token Pruning in Large Vision-Language Models},
  author = {Changwoo Baek and Jouwon Song and Sohyeon Kim and Kyeongbo Kong},
  journal= {arXiv preprint arXiv:2603.01236},
  year   = {2026}
}

备注

Accepted to ICLR 2026