中文

大型语言模型压缩顺序的系统性研究

机器学习 2025-11-26 v1 人工智能

摘要

大型语言模型(LLM)需要大量计算资源,使得模型压缩对于在受限环境中高效部署至关重要。在主流的压缩技术中:知识蒸馏、结构化剪枝和低比特量化,它们各自的效应已被充分研究,但它们之间的交互作用和最优排序仍不清楚。本工作系统地研究了这些技术在独立应用及组合应用时的表现,应用于 Qwen2.5 3B 模型。我们评估了多种压缩流水线,包括单技术流水线以及提出的三技术序列,使用困惑度、G-Eval、清晰度、提示对齐度和压缩比作为评估指标。实验表明,量化提供了最大的独立压缩效果,而剪枝引入了中等程度的品质退化。关键的是,技术的排序显著影响最终模型品质:剪枝、知识蒸馏、量化(P-KD-Q)的顺序取得了最佳平衡,在保持较强的指令遵循和语言理解能力的同时实现了 3.68 倍的压缩比。相反,早期应用量化的流水线因不可逆的信息损失而遭受严重性能退化,从而损害了后续训练。总体而言,本研究为在资源受限环境中部署 LLM 时设计有效的、考虑排序的压缩流水线提供了实用见解。

关键词

引用

@article{arxiv.2511.19495,
  title  = {A Systematic Study of Compression Ordering for Large Language Models},
  author = {Shivansh Chhawri and Rahul Mahadik and Suparna Rooj},
  journal= {arXiv preprint arXiv:2511.19495},
  year   = {2025}
}