中文

别贪婪,只去 relax!基于 Frank-Wolfe 的 LLM 剪枝

机器学习 2025-10-16 v1 最优化与控制

摘要

剪枝是一种减少神经网络计算和存储需求的常用技术。虽然传统方法通常通过重新训练来恢复剪枝导致的性能下降,但最新的大型语言模型 (LLM) 剪枝方法则按层级最小化校准数据集上单层剪枝误差,以避免完整重新训练,被认为对 LLM 计算成本过高。然而,寻找最优剪枝掩码是一项困难的组合问题,无法求解最优解。现有方法因此依赖贪心启发式方法,忽略剪枝目标中权重之间的相互作用。本文我们采用这些组合约束的凸松弛,并使用 Frank-Wolfe (FW) 算法求解。我们的方法大幅降低单层剪枝误差,在最新的 GPT 架构上超越强基准,同时保持内存效率。我们通过表明,结合 FW 算法的收敛保证,我们可在对松弛解进行取整至整数后获得原组合问题的近似解,从而对方法进行理论依据。

关键词

引用

@article{arxiv.2510.13713,
  title  = {Don't Be Greedy, Just Relax! Pruning LLMs via Frank-Wolfe},
  author = {Christophe Roux and Max Zimmer and Alexandre d'Aspremont and Sebastian Pokutta},
  journal= {arXiv preprint arXiv:2510.13713},
  year   = {2025}
}