CALR:用于高效大语言模型层压缩的纠正性自适应低秩分解
机器学习
2025-08-27 v2 人工智能
摘要
大语言模型(LLM)因其庞大规模和计算需求,在实际部署中面临重大挑战。模型压缩技术对于使这些模型在资源受限的环境中实用化至关重要。一种 prominent 的压缩策略是通过奇异值分解(SVD)进行低秩因子化,以通过近似权重矩阵来减少模型参数。然而,标准SVD聚焦于最小化矩阵重构误差,常导致模型功能性能的显著下降。这种性能衰减是由于现有方法未能充分纠正压缩过程中丢失的功能信息。为解决这一 gap,我们提出了纠正性自适应低秩分解(CALR),这是一种包含两个组成部分的压缩方法。CALR 将SVD压缩层的主路径与一个并行的、可学习的低秩纠正模块相结合,该模块专门训练以恢复功能残差误差。我们对 SmolLM2-135M、Qwen3-0.6B 和 Llama-3.2-1B 的实验评估表明,CALR 可将参数数量降低 26.93% 至 51.77%,同时保留 59.45% 至 90.42% 的原始模型性能,始终优于 LaCo、ShortGPT 和 LoSparse。CALR 的成功表明,将功能信息损失视为可学习信号是一种高度有效的压缩范式。这种方法使得创建显著更小、更高效的 LLM 成为可能,推动了其在实际应用中可访问性和实用部署。
引用
@article{arxiv.2508.16680,
title = {CALR: Corrective Adaptive Low-Rank Decomposition for Efficient Large Language Model Layer Compression},
author = {Muchammad Daniyal Kautsar and Afra Majida Hariono and Widyawan and Syukron Abu Ishaq Alfarozi and Kuntpong Woraratpanya},
journal= {arXiv preprint arXiv:2508.16680},
year = {2025}
}
备注
Submitted to IEEE Transactions on Artificial Intelligence. This is the preprint version, not peer-reviewed. The final version may differ after peer review. (11 pages, 3 figures)