中文

CASP:基于注意力稀疏性的大型多模态模型压缩

计算机视觉与模式识别 2025-03-11 v1

摘要

在本工作中,我们提出了一种针对大型多模态模型(Large Multimodal Models, LMMs)的极致压缩技术。虽然先前的研究已经探索了将量化作为大型语言模型(Large Language Models, LLMs)的高效训练后压缩方法,但多模态模型的低位压缩仍有待深入探索。多模态模型中输入的冗余性质导致了高度稀疏的注意力矩阵。我们在理论和实验上证明了,注意力矩阵的稀疏性界定了 Query 和 Key 权重矩阵的压缩误差。基于此,我们引入了 CASP,一种针对 LMMs 的模型压缩技术。我们的方法对 Query 和 Key 权重矩阵执行数据感知的低秩分解,随后基于最优比特分配过程对所有层进行量化。CASP 兼容任何量化技术,并在图像和视频语言基准上使最先进的 2-bit 量化方法(AQLM 和 QuIP#)平均提升 21%。

关键词

引用

@article{arxiv.2503.05936,
  title  = {CASP: Compression of Large Multimodal Models Based on Attention Sparsity},
  author = {Mohsen Gholami and Mohammad Akbari and Kevin Cannons and Yong Zhang},
  journal= {arXiv preprint arXiv:2503.05936},
  year   = {2025}
}