AlphaPruning:利用重尾自正则化理论提高大语言模型的分层剪枝
机器学习
2024-10-16 v1 机器学习
摘要
最近的工作表明,可以在不损害性能的情况下消除大量参数,使剪枝成为降低大语言模型(LLM)模型规模的有前景策略。现有的 LLM 剪枝策略通常在各层分配统一的剪枝比例,限制了整体剪枝能力;而近期针对 LLM 的分层剪枝工作常基于启发式方法,容易导致次优性能。本文利用重尾自正则化(HT-SR)理论,特别是权重矩阵经验谱密度(ESD)的形状,设计了改进的分层剪枝比例。我们的分析揭示了不同层在训练后表现如何以及因此如何可剪枝之间的巨大差异。基于此,我们提出 AlphaPruning,该方法利用形状度量指标以更为理论原则的方式分配分层稀疏比例。AlphaPruning 可与多种现有 LLM 剪枝方法结合使用。我们的实证结果表明,AlphaPruning 将 LLaMA-7B 剪枝至 80\% 稀疏度,同时保持合理的困惑度,这在 LLM 文献中首次实现。我们已在 https://github.com/haiquanlu/AlphaPruning 上开源代码。
引用
@article{arxiv.2410.10912,
title = {AlphaPruning: Using Heavy-Tailed Self Regularization Theory for Improved Layer-wise Pruning of Large Language Models},
author = {Haiquan Lu and Yefan Zhou and Shiwei Liu and Zhangyang Wang and Michael W. Mahoney and Yaoqing Yang},
journal= {arXiv preprint arXiv:2410.10912},
year = {2024}
}
备注
NeurIPS 2024, first two authors contributed equally