ARA:用于高效大型语言模型 SVD 压缩的自适应秩分配
机器学习
2025-10-23 v1
摘要
在大型语言模型 (LLM) 压缩领域,奇异值分解 (SVD) 是广受关注且广泛采用的低秩分解技术。由于 SVD 仅作用于线性模块,而这些模块被非线性组件隔开,SVD 只能独立应用于每个线性模块。在全局压缩比率约束下,确定不同线性模块的合适秩成为关键问题。现有方法,如启发式算法和掩码基训练,虽已取得进展,但仍存在若干局限:启发式算法在受限区域内探索解空间,而掩码基训练难以有效捕获奇异值谱与可训练参数之间的关系。更重要的是,当前方法忽略了在压缩比率为 1 时增益函数呈非光滑性的关键特性,这常导致训练过程陷入次优局部最小值。为此,我们提出了自适应秩分配 (ARA) 方法。具体而言,(1) ARA 引入专门的掩码设计,实现保留秩与可训练参数之间的高效映射与更新;(2) 采用额外的损失函数引导参数选择趋向全局最优解。实验结果表明,ARA 取得了最先进的性能。在以 80% 压缩比率压缩 LLaMA2-7B 模型时,ARA 将 WikiText2 上的困惑度从 8.38 降至 6.42,平均零样本任务准确率提升 9.72 个百分点。这些结果凸显了 ARA 在 SVD 基于 LLM 压缩中进行秩分配的有效性。
引用
@article{arxiv.2510.19389,
title = {ARA: Adaptive Rank Allocation for Efficient Large Language Model SVD Compression},
author = {Lin Xv and Jingsheng Gao and Xian Gao and Ting Liu and Yuzhuo Fu},
journal= {arXiv preprint arXiv:2510.19389},
year = {2025}
}