面向压缩大语言模型的层级动态秩
机器学习
2025-10-07 v2
摘要
大语言模型(LLM)规模快速增长,带来严重的内存和计算挑战,阻碍其部署。基于奇异值分解(SVD)的压缩方法已成为 LLM 后训练压缩的引人注目的技术,但大多数现有方法在所有层上应用统一的压缩比率,隐含地假设各层信息均匀。这忽略了 LLM 中观察到的显著层内异质性——中间层倾向于编码更丰富的信息,而早期和后期层更冗余。本文重新审视现有的 SVD 基于压缩方法,提出 D-Rank,即一种具有层级动态秩分配的 LLM 压缩框架。我们首先引入有效秩作为衡量权矩阵信息密度的原则性指标,然后通过拉格朗日乘子优化方案分配秩,在固定压缩比率下对信息密度更高的组分配更多容量。此外,我们考虑注意力层的不同重要性,对分配的秩进行再平衡,并将 D-Rank 扩展到最新的带分组查询注意力的 LLM。在多个压缩比率下,对不同规模的 LLM 进行大量实验,表明 D-Rank 在压缩 LLaMA-3-8B 模型的 C4 数据集上比 SVD-LLM、ASVD 和 Basis Sharing consistently outperform,实现 15% 以上的 perplexity 下降,在 LLaMA-7B 模型上实现最高 5% 的零样本推理准确率提升,同时实现更高的吞吐量。
引用
@article{arxiv.2509.25622,
title = {Layer-wise dynamic rank for compressing large language models},
author = {Zhendong Mi and Bian Sun and Grace Li Zhang and Shaoyi Huang},
journal= {arXiv preprint arXiv:2509.25622},
year = {2025}
}
备注
10 pages, 5 figures