面向高剪枝率的大型视觉语言模型:缓解信息损失
计算机视觉与模式识别
2025-08-05 v1
摘要
尽管大型视觉语言模型 (LVLMs) 在各方面取得了巨大成功,但其高计算成本严重限制了其在广泛应用中的潜力。LVLMs 的计算成本主要来自输入的视觉序列,后者包含数百乃至数千个 token。虽然已有方法通过删除冗余 token 来取得进展,但在高剪枝率下会出现严重的性能下降,这源于视觉信息的丢失。本文提出了一种自适应内容补偿方法 (ACCM),可通过图像说明有效缓解视觉信息损失。具体地,ACCM 包含两个关键组件:一个轻量级说明模型和一个选择器。首先,在用户指令的指导下,说明模型生成与问题相关的描述。然后,选择器从多个候选说明中进一步识别一个情境上恰当的说明。利用自监督学习,我们的模块可以在没有任何人类或自动标注的情况下高效学习。在七个基准测试上进行了大量实验,结果表明,ACCM 在更低的 FLOPs 下显著优于现有方法(例如,以 6.5% 更少的 FLOPs 超过 SOTA 20.6%)。
引用
@article{arxiv.2508.01236,
title = {Mitigating Information Loss under High Pruning Rates for Efficient Large Vision Language Models},
author = {Mingyu Fu and Wei Suo and Ji Ma and Lin Yuanbo Wu and Peng Wang and Yanning Zhang},
journal= {arXiv preprint arXiv:2508.01236},
year = {2025}
}
备注
accepted by ACM MM 2025