中文

Týr-the-Pruner:通过全局稀疏分布优化进行LLM结构剪枝

机器学习 2025-10-22 v4

摘要

结构剪枝可增强大语言模型(LLM)的硬件无关推理效率,但通常难以保持可比性能。局部剪枝可高效地进行逐层压缩,但忽略了全局拓扑。尽管全局剪枝旨在识别最优稀疏模型,直观方法通常采用两阶段范式——先评估子结构显著性再应用全局剪枝——这忽略了结构间依赖且未能实现端到端优化。为解决这些局限性,我们提出Týr-the-Pruner,一个高效的端到端搜索式全局结构剪枝框架。该框架通过在LLM的每一层上反复应用局部剪枝(涵盖一系列稀疏率)来构建超网络,核心目标是在目标总体稀疏率下确定最优稀疏分布。具体而言,我们引入了一种有效的局部剪枝和期望误差累积方法来改进超网络构建。此外,我们采用从粗到细的稀疏粒度迭代剪枝-搜索策略以确保高效搜索收敛。实验结果表明,Týr-the-Pruner实现了最先进的全局结构剪枝,在移除Llama-3.1-70B中50%的参数(具有挑战性的比例)的同时保留了稠密模型97%的性能。代码将在https://github.com/AMD-AGI/Tyr-the-Pruner上公开。

关键词

引用

@article{arxiv.2503.09657,
  title  = {T\'yr-the-Pruner: Structural Pruning LLMs via Global Sparsity Distribution Optimization},
  author = {Guanchen Li and Yixing Xu and Zeping Li and Ji Liu and Xuanwu Yin and Dong Li and Emad Barsoum},
  journal= {arXiv preprint arXiv:2503.09657},
  year   = {2025}
}