中文

ECoFLaP:面向视觉-语言模型的高效由粗到细逐层剪枝

计算机视觉与模式识别 2024-01-29 v2 人工智能 计算与语言 机器学习

摘要

大型视觉-语言模型(LVLMs)能够通过整合来自不同模态的丰富信息来全面理解世界,在各种多模态下游任务上取得了显著进展。然而,由于其巨大的计算/能耗成本和碳排放,部署 LVLMs 往往存在问题。此类问题使得采用传统的迭代式全局剪枝变得不可行,因为对整个人型模型计算 Hessian 矩阵以进行稀疏化代价高昂。作为替代,近期若干研究提出了逐层剪枝方法,以避免全局剪枝的昂贵计算,并根据层内重要性高效压缩模型权重。然而,由于缺乏全局视角,它们常遭受次优的模型压缩。为解决近期大模型高效剪枝方法中的这一局限,我们提出高效由粗到细逐层剪枝(ECoFLaP),一种面向 LVLMs 的两阶段由粗到细权重剪枝方法。我们首先利用全局重要性分数确定不同层或块的稀疏比,该分数基于全局模型梯度的零阶近似高效计算。随后,模型基于全局告知的稀疏比执行局部逐层非结构化权重剪枝。我们在多种多模态与单模态模型及数据集上验证了所提方法,证明了在高稀疏度状态下相较主流剪枝技术的显著性能提升。

关键词

引用

@article{arxiv.2310.02998,
  title  = {ECoFLaP: Efficient Coarse-to-Fine Layer-Wise Pruning for Vision-Language Models},
  author = {Yi-Lin Sung and Jaehong Yoon and Mohit Bansal},
  journal= {arXiv preprint arXiv:2310.02998},
  year   = {2024}
}

备注

ICLR 2024 (project page: https://ecoflap.github.io/)