中文

Olica:无需重新训练的大语言模型高效结构化剪枝

计算与语言 2025-06-11 v1 机器学习

摘要

现有的大语言模型(Large Language Models, LLMs)结构化剪枝方法大多需要 substantial 计算和数据资源进行重新训练以重建被破坏的相关性,这使得它们在成本上难以接受。为此,我们提出一种名为正交分解和线性校准(Orthogonal decomposition and Linear Calibration, Olica)的剪枝框架,无需重新训练即可实现。我们的关键观察是,多头注意力(Multi-Head Attention, MHA)层依赖于两种类型的矩阵乘积。将这些矩阵乘积视为统一实体并应用主成分分析(Principal Component Analysis, PCA),即可在不牺牲准确性或破坏原始结构的情况下,从LLMs中提取最重要的信息进行压缩。因此,无需重新训练。我们设计了一种快速分解方法,将PCA的复杂度降低为注意力头数的平方。此外,为缓解剪枝前馈网络(Feed-Forward Network, FFN)层导致的误差累积问题,我们引入线性校准方法,通过低秩矩阵重建被剪枝层的残差误差。通过对最小二乘问题的解进行奇异值分解(Singular Value Decomposition, SVD),这些矩阵无需重新训练即可获得。广泛的实验表明,所提出的Olica在数据使用、GPU内存和运行时间方面都具有高效优势,同时在多个基准测试中表现出优异的性能。

关键词

引用

@article{arxiv.2506.08436,
  title  = {Olica: Efficient Structured Pruning of Large Language Models without Retraining},
  author = {Jiujun He and Huazhen Lin},
  journal= {arXiv preprint arXiv:2506.08436},
  year   = {2025}
}

备注

Accepted to ICML 2025