中文

MoreauPruner:对大型语言模型进行稳健剪枝以抵御权重扰动

机器学习 2024-06-12 v1 计算与语言

摘要

few-shot 梯度方法在现有模型剪枝方法中被广泛利用,其中将模型权重视为静态值,未考虑潜在权重扰动的影响。然而,参数数十亿的大型语言模型(LLM)可能增加 few-shot 梯度剪枝的脆弱性。在本工作中,我们实验表明,一轮梯度剪枝算法在模型权重受扰动时会导致不稳定的结果。并且,数据格式从 bfloat16 切换到 float16 的微小差异可能导致截然不同的结果。为解决此类不稳定性,我们利用优化分析提出了一种 LLM 结构化剪枝方法,称为 MoreauPruner,能够对权重扰动提供可证明的鲁棒性。在 MoreauPruner 中,基于神经网络的 Moreau 包络估计模型权重的重要性,这可以灵活地与 1\ell_1 正则化技术结合,以在剪枝任务中引导稀疏性。我们在几个著名的 LLM 上广泛评估了 MoreauPruner 算法,包括 LLaMA-7B、LLaMA-13B、LLaMA3-8B 和 Vicuna-7B。我们的 numerical 结果表明 MoreauPruner 在权重扰动下具有鲁棒性,并指出 MoreauPruner 在准确率方面相对于几种现有剪枝方法成功。我们已在 \url{https://github.com/ShiningSord/MoreauPruner} 上发布代码。

关键词

引用

@article{arxiv.2406.07017,
  title  = {MoreauPruner: Robust Pruning of Large Language Models against Weight Perturbations},
  author = {Zixiao Wang and Jingwei Zhang and Wenqian Zhao and Farzan Farnia and Bei Yu},
  journal= {arXiv preprint arXiv:2406.07017},
  year   = {2024}
}