中文

面向高剪枝率的大型视觉语言模型:缓解信息损失

计算机视觉与模式识别 2025-08-05 v1

摘要

尽管大型视觉语言模型 (LVLMs) 在各方面取得了巨大成功,但其高计算成本严重限制了其在广泛应用中的潜力。LVLMs 的计算成本主要来自输入的视觉序列,后者包含数百乃至数千个 token。虽然已有方法通过删除冗余 token 来取得进展,但在高剪枝率下会出现严重的性能下降,这源于视觉信息的丢失。本文提出了一种自适应内容补偿方法 (ACCM),可通过图像说明有效缓解视觉信息损失。具体地,ACCM 包含两个关键组件:一个轻量级说明模型和一个选择器。首先,在用户指令的指导下,说明模型生成与问题相关的描述。然后,选择器从多个候选说明中进一步识别一个情境上恰当的说明。利用自监督学习,我们的模块可以在没有任何人类或自动标注的情况下高效学习。在七个基准测试上进行了大量实验,结果表明,ACCM 在更低的 FLOPs 下显著优于现有方法(例如,以 6.5% 更少的 FLOPs 超过 SOTA 20.6%)。

关键词

引用

@article{arxiv.2508.01236,
  title  = {Mitigating Information Loss under High Pruning Rates for Efficient Large Vision Language Models},
  author = {Mingyu Fu and Wei Suo and Ji Ma and Lin Yuanbo Wu and Peng Wang and Yanning Zhang},
  journal= {arXiv preprint arXiv:2508.01236},
  year   = {2025}
}

备注

accepted by ACM MM 2025