MGAA:面向LLM低秩压缩的多粒度自适应参数分配
机器学习
2025-07-08 v1 人工智能
摘要
大型语言模型(LLM)的庞大参数规模使模型压缩成为研究热点,旨在缓解部署和推理期间的计算资源需求。作为一种有前景的方向,低秩近似技术取得了显著成果。然而,广数研究将低秩压缩压缩比例统一应用于所有权力矩阵,忽略了其对模型性能影响的内在差异。尽管近期的一些工作尝试采用启发式搜索策略实现最优参数分配,但这些策略计算效率低下,在LLM时代失去了泛化能力。在本研究中,我们提出一种新颖的参数多粒度自适应分配(MGAA)方法,能够在压缩过程中在子层之间以及在子层内部自适应分配参数,而无需针对特定任务进行评估。MGAA包含两个组件:1)在不同子层之间,它根据它们输入与输出之间的余弦相似度分配压缩比例,允许对重要性不同的子层进行更有针对性的压缩;2)在每个子层内部,它根据权力矩阵的能量分布特征分配不同的压缩比例,确保能量保留比例一致,同时优化压缩效率。对MGAA在多个LLM backbone模型和基准数据集上的全面评估表明其性能卓越。此外,我们将MGAA应用于多模态模型LLaVA,显示出显著的性能提升。
引用
@article{arxiv.2507.03294,
title = {MGAA: Multi-Granular Adaptive Allocation fof Low-Rank Compression of LLMs},
author = {Guangyan Li and Yongqiang Tang and Wensheng Zhang},
journal= {arXiv preprint arXiv:2507.03294},
year = {2025}
}
备注
13 pages, 8 figures