中文

LEAP:可学习的面向大型语言模型的端到端自适应剪枝

机器学习 2026-05-19 v1 人工智能

摘要

无结构稀疏性现已被最新的 GPU 内核和数据流硬件原生加速,使推理执行的瓶颈从算法转向剪枝算法。针对无结构 LLM 剪枝的最新方法是从 Optimal Brain Surgeon 原理派生的逐层代理方法,在激进稀疏性下牺牲端到端准确性。端到端替代方案如 MaskLLM 和 PATCH 显示,可学习的掩码可弥合这一差距,但其基于类别-模式的参数化方式随每个行的有效掩码数量而扩展,无法移植到无结构设置。我们提出了 LEAP,用每个权重的伯努利-通过-Gumbel-sigmoid 松弛替代该不可计算的参数化,使端到端无结构掩码学习变得可行。在来自 0.5B 至 8B 参数的五个 LLM 家族中进行 50% 和 60% 稀疏性测试,LEAP 在六项任务的平均零样本准确性上相较于 ADMM(我们扫描中最好的逐层基线)提升平均 +2.59 分。

关键词

引用

@article{arxiv.2605.17289,
  title  = {LEAP: Learnable End-to-End Adaptive Pruning of Large Language Models},
  author = {Mohammad Mozaffari and Younes Hourri and Mohammad Rastegari and Mahyar Najibi},
  journal= {arXiv preprint arXiv:2605.17289},
  year   = {2026}
}