大型语言模型的对称剪枝
机器学习
2025-02-03 v1 人工智能
摘要
后训练剪枝方法如Wanda和RIA因其简单而有效的设计而备受推崇,已展现出卓越的实证性能。Wanda通过在剪枝期间进行校准化激活来优化性能,而RIA强调权重元素相对重要性而非绝对重要性。尽管这些方法在实际中取得了成功,但对这些结果的彻底理论基础仍存缺失。本文提出了新的理论见解,重新定义剪枝的标准最小化目标,深入理解这些成功因素的作用。我们进一步提出了兼顾输入激活和权重重要性的补充策略。通过严格实验验证,我们证明这些方法显著优于现有方法。此外,我们引入了一种新颖的训练无关微调方法$R^2$DSnoT,融合相对权重重要性和正则化决策边界于动态剪枝-生长框架中,显著超越强大基准,树立了新的SOTA。
引用
@article{arxiv.2501.18980,
title = {Symmetric Pruning of Large Language Models},
author = {Kai Yi and Peter Richtárik},
journal= {arXiv preprint arXiv:2501.18980},
year = {2025}
}