盘古轻量:用于剪枝和加速大语言模型的权重重初始化
计算与语言
2025-05-27 v1
摘要
大语言模型(LLMs)在众多任务中展现出最先进的能力,但其庞大的规模和推理成本为实际部署带来了显著的计算挑战。虽然结构化剪枝为模型压缩提供了一条有前景的途径,但现有方法常常难以应对同时、激进地缩减宽度和深度所带来的不利影响,导致性能大幅下降。本文认为,使这种激进的联合剪枝变得可行的关键且常被忽视的方面,是对剩余权重进行策略性的重初始化和调整,以改善模型剪枝后的训练精度。我们引入了 Pangu Light,这是一个以结构化剪枝为核心,并辅以旨在解决这一“缺失环节”的新型权重重初始化技术的大语言模型加速框架。我们的框架系统地针对多个维度,包括模型宽度、深度、注意力头和 RMSNorm,其有效性植根于诸如跨层注意力剪枝(CLAP)和稳定化层归一化剪枝(SLNP)等新型重初始化方法,这些方法通过为网络提供一个更好的训练起点来缓解性能下降。为了进一步提升效率,Pangu Light 融合了专门的优化,例如吸收后 RMSNorm 计算,并针对 Ascend NPU 的特性定制其策略。Pangu Light 模型始终展现出优越的精度-效率权衡,优于 Nemotron 等主流基线剪枝方法和 Qwen3 系列等成熟的大语言模型。例如,在 Ascend NPU 上,Pangu Light-32B 的 81.6 平均分和 2585 tokens/s 的吞吐量超过了 Qwen3-32B 的 80.9 平均分和 2225 tokens/s。
引用
@article{arxiv.2505.20155,
title = {Pangu Light: Weight Re-Initialization for Pruning and Accelerating LLMs},
author = {Hanting Chen and Jiarui Qin and Jialong Guo and Tao Yuan and Yichun Yin and Huiling Zhen and Yasheng Wang and Jinpeng Li and Xiaojun Meng and Meng Zhang and Rongju Ruan and Zheyuan Bai and Yehui Tang and Can Chen and Xinghao Chen and Fisher Yu and Ruiming Tang and Yunhe Wang},
journal= {arXiv preprint arXiv:2505.20155},
year = {2025}
}