中文

AA-SVD:用于大型语言模型压缩的锚定自适应奇异值分解

机器学习 2026-04-03 v1

摘要

我们提出了一种基于低秩分解的快速框架,用于压缩大型语言模型,使其能够在无需重新训练的情况下快速压缩数十亿参数模型。与现有基于分解的方法不同,后者仅优化原始输入,忽略上游压缩引起的分布偏移,导致误差向前传播;或仅依赖偏移输入,风险偏离原始输出。我们的方法同时考虑这两者。除了单层压缩外,我们进一步对每个Transformer块进行端到端优化,最小化块级输出失真,使压缩层能够共同补偿累积误差。通过在每个压缩层锚定到原始输出的同时显式建模输入分布偏移, our method finds a low-rank approximation that maintains functional equivalence with the original model. 在大型语言模型上的实验表明,我们的方法在各种压缩比例下均优于现有基于SVD的基线方法,尤其在激进压缩预算下,竞争方法会大幅降级甚至完全崩溃,提供了一种高效、大规模模型部署的实用解决方案。

关键词

引用

@article{arxiv.2604.02119,
  title  = {AA-SVD : Anchored and Adaptive SVD for Large Language Model Compression},
  author = {Atul Kumar Sinha and François Fleuret},
  journal= {arXiv preprint arXiv:2604.02119},
  year   = {2026}
}