迈向高效的视觉语言模型:基于信息论驱动的自适应结构剪枝压缩
计算机视觉与模式识别
2025-11-26 v1 人工智能
信息论
机器学习
math.IT
摘要
视觉语言模型(VLM)的最新进展在多模态任务上展现了显著性能,但其不断增长的规模对部署和效率构成了严峻挑战。现有的压缩方法通常依赖启发式重要性指标或经验剪枝规则,缺乏关于信息保留的理论保证。在本工作中,我们提出InfoPrune,一个用于VLM自适应结构压缩的信息论框架。基于信息瓶颈原理,我们将剪枝形式化为保留任务相关语义与丢弃冗余依赖之间的权衡。为量化每个注意力头的贡献,我们引入基于熵的有效秩(eRank),并使用柯尔莫哥洛夫-斯米尔诺夫(KS)距离来衡量原始结构与压缩结构之间的差异。这产生了一个联合考虑结构稀疏性和信息效率的统一准则。在此基础上,我们进一步设计了两个互补方案:(1) 由提出的信息损失目标引导的基于训练的注意力头剪枝,以及 (2) 通过自适应低秩近似实现的无训练FFN压缩。在VQAv2、TextVQA和GQA上的大量实验表明,InfoPrune实现了高达3.2倍的FLOP减少和1.8倍的加速,且性能退化可忽略不计,为高效多模态大模型奠定了理论基础并提供了实用有效的步骤。
引用
@article{arxiv.2511.19518,
title = {Towards Efficient VLMs: Information-Theoretic Driven Compression via Adaptive Structural Pruning},
author = {Zhaoqi Xu and Yingying Zhang and Jian Li and Jianwei Guo and Qiannan Zhu and Hua Huang},
journal= {arXiv preprint arXiv:2511.19518},
year = {2025}
}