LVLM-Compress-Bench:大型视觉语言模型压缩广泛影响的基准测试
计算机视觉与模式识别
2025-03-10 v1 人工智能
计算与语言
摘要
尽管近期在理解压缩对大型语言模型(LLMs)的影响方面已取得进展,涉及其在下游任务性能和在相对简单的单模态基准(如问答、常识推理)上的可信度,但对多模态大型视觉语言模型(LVLMs)的详细研究尚未揭示。为了弥补这一空白,我们提出了LVLM-Compress-Bench,一个首先全面研究压缩对多模态输入驱动任务中LVLM生成性能广泛影响的框架。具体而言,我们考虑了自回归模型的两种主要压缩类别,即KV缓存和权重压缩,分别针对动态增长的中间缓存和静态权重。我们使用流行的LLaVA框架的四个LVLM变体,通过整合各种最先进的KV和权重压缩方法(包括KV缓存和权重的均匀压缩、异常值减少压缩和分组量化)来呈现我们的分析。通过该框架,我们在十个不同的多模态数据集上进行了演示,这些数据集具有不同的能力,包括识别、知识、语言生成、空间感知、视觉推理、幻觉和视觉错觉识别、毒性、刻板印象和偏见。具体而言,我们的框架展示了压缩对一般指标和伦理关键指标的影响,利用真实数据集和合成数据集的组合来涵盖多样的社会交叉属性。广泛的实验评估揭示了LVLM在不同KV和权重量化预算下的行为多样性,以及与FP16数据格式的基线模型相比在保持和丢失性能方面的差异。代码将在https://github.com/opengear-project/LVLM-compress-bench开源。
引用
@article{arxiv.2503.04982,
title = {LVLM-Compress-Bench: Benchmarking the Broader Impact of Large Vision-Language Model Compression},
author = {Souvik Kundu and Anahita Bhiwandiwalla and Sungduk Yu and Phillip Howard and Tiep Le and Sharath Nittur Sridhar and David Cobbley and Hao Kang and Vasudev Lal},
journal= {arXiv preprint arXiv:2503.04982},
year = {2025}
}
备注
This work has been accepted to NAACL 2025