ASVD:用于压缩大型语言模型的激活感知奇异值分解
计算与语言
2025-08-29 v5
摘要
在本文中,我们引入了一种新的大型语言模型 (LLM) 训练后压缩范式,以促进其更广泛的应用。我们深入研究了 LLM 权重低秩分解,并发现该任务的挑战源于 (1) LLM 激活中的分布方差和 (2) 不同类型层之间的敏感度差异。为了解决这些问题,我们提出了一种称为激活感知奇异值分解 (ASVD) 的免训练方法。具体而言,ASVD 通过基于激活分布变换权重矩阵来处理激活异常值。这种变换允许将激活矩阵中的异常值吸收到变换后的权重矩阵中,从而提高分解精度。此外,我们提出了一种高效的迭代校准过程,通过解决不同 LLM 层的不同敏感度来优化特定层的分解。通过这种方式,ASVD 可以将网络压缩 10%-30%。基于自注意力模块中投影矩阵低秩分解的成功,我们进一步引入 ASVD 来压缩 KV cache。通过减少 KV 激活的通道维度,可以大幅降低对 KV cache 的内存需求。ASVD 可以在免训练的方式下进一步实现 50% 的 KV cache 压缩,且性能不下降。
引用
@article{arxiv.2312.05821,
title = {ASVD: Activation-aware Singular Value Decomposition for Compressing Large Language Models},
author = {Zhihang Yuan and Yuzhang Shang and Yue Song and Dawei Yang and Qiang Wu and Yan Yan and Guangyu Sun},
journal= {arXiv preprint arXiv:2312.05821},
year = {2025}
}