中文

UniPruning:统一局部度量与全局反馈用于可扩展稀疏大语言模型

机器学习 2025-12-10 v2 人工智能

摘要

大语言模型(LLMs)在多样化任务上实现了强大的性能,但面临计算和内存成本的禁锢。剪枝提供了一条通过诱导稀疏性同时保持架构灵活性的道路。然而,现有方法在效率和鲁棒性之间难以平衡:局部度量方法逐层修剪但常在高稀疏度下崩溃,而全局反馈方法在强制一致性方面却面临昂贵的权重更新或限制性的半结构化格式。我们提出 UniPruning,一个统一的后训练剪枝框架,将局部灵敏度度量的速度与全局协调的稳定性结合起来,无需更新模型权重。UniPruning 利用快速的层级评分和轻量级全局控制器分配单一稀疏预算,支持一种框架内的非结构化和半结构化 N:M 剪枝。经过简短的校准后,可以一次性为任意稀疏度生成剪枝掩码,并无缝适应硬件感知约束。在多个预训练 LLM 家族和标准基准测试上的大规模实验表明,UniPruning 持续地在困惑度和零样本准确率方面实现竞争甚至优于。消融研究进一步凸显了镜像梯度和局部灵敏度锚定的重要性。总体而言,UniPruning 提供了一个高效、原则且可扩展的大规模 LLM 稀疏化解决方案。我们的代码可在:https://github.com/RainbowQTT/UniPruning 查阅。

关键词

引用

@article{arxiv.2510.03291,
  title  = {UniPruning: Unifying Local Metric and Global Feedback for Scalable Sparse LLMs},
  author = {Yizhuo Ding and Wanying Qu and Jiawei Geng and Wenqi Shao and Yanwei Fu},
  journal= {arXiv preprint arXiv:2510.03291},
  year   = {2025}
}