中文

重新评估 LLM 中的层级剪枝:新视角与方法

机器学习 2024-11-26 v1 计算机视觉与模式识别

摘要

尽管大型语言模型 (LLM) 在各个领域取得了显著的成功,但其庞大的规模需要巨大的计算资源,给资源受限的环境部署带来了重大挑战。层级剪枝作为一种简单而有效的压缩方法,直接移除模型的层级,从而降低计算开销。然而,LLM 中进行层级剪枝的最佳实践是什么?复杂的层级选择指标是否真正有效? LoRA (低秩近似) 系列方法,广为认为是对被剪枝模型进行微调的领先方法,在应用于后剪枝微调时是否真正达到了预期效果?为了回答这些问题,我们投入数千个 GPU 小时,对 LLM 中的层级剪枝进行基准测试,并从多个维度获得洞见。我们的结果表明,一种简单的方法——即剪枝后最后 25% 的层级,然后微调 lm_head 及其余最后三层——能获得极其强大的性能。遵循这一指南,我们对 Llama-3.1-8B-It 进行剪枝,得到的模型在许多规模相似的流行 LLM 上表现更优,例如 ChatGLM2-6B、Vicuna-7B-v1.5、Qwen1.5-7B 和 Baichuan2-7B。我们在 Huggingface 上发布了最优模型权重,代码在 GitHub 上可用。

关键词

引用

@article{arxiv.2411.15558,
  title  = {Reassessing Layer Pruning in LLMs: New Insights and Methods},
  author = {Yao Lu and Hao Cheng and Yujie Fang and Zeyu Wang and Jiaheng Wei and Dongwei Xu and Qi Xuan and Xiaoniu Yang and Zhaowei Zhu},
  journal= {arXiv preprint arXiv:2411.15558},
  year   = {2024}
}