STADE:基于标准差的剪枝度量
机器学习
2025-09-08 v2
摘要
最近,大型语言模型(LLM)广泛应用于各种任务。为了成功处理这些任务,LLM需要更长的训练时间和更大的模型规模。这使得LLM成为能够在保持性能的同时减少计算需求的剪枝方法的理想候选人。以往的方法在剪枝后需要重新训练以维持原始模型的性能。然而,诸如Wanda等前沿剪枝方法可在无需重新训练的情况下进行剪枝,从而加快并提高了剪枝过程的效率。基于Wanda的工作基础上,本研究提供了该方法有效性的理论解释,并利用这些见解来增强剪枝过程。具体而言,剪枝问题的理论分析揭示了机器学习中常见情形,表明Wanda是最佳剪枝方法。此外,将该分析扩展到Wanda不再最优的情况,从而发展出一种基于输入标准差的新方法STADE。从理论角度看,STADE在不同情形下的普适性更好。最终,通过在Llama和Open Pre-trained Transformers(OPT)模型上的大量实验验证了这些理论发现,表明根据训练条件,Wanda的优异性能如被理论框架预测的那样会有所变化。这些见解有助于更稳健地理解剪枝策略及其实际应用。代码已公开:https://github.com/Coello-dev/STADE/
引用
@article{arxiv.2503.22451,
title = {STADE: Standard Deviation as a Pruning Metric},
author = {Diego Coello de Portugal Mecke and Haya Alyoussef and Maximilian Stubbemann and Ilia Koloiarov and Tom Hanika and Lars Schmidt-Thieme},
journal= {arXiv preprint arXiv:2503.22451},
year = {2025}
}