中文

NoWag:面向保持形状的大型语言模型压缩的统一框架

机器学习 2026-01-29 v5 人工智能

摘要

大型语言模型(LLMs)在 various 自然语言处理任务中表现出卓越的性能,但因计算和内存需求巨大,限制了其在资源受限环境中的部署。为此,我们提出 NoWag(Normalized Weight and Activation Guided Compression),即面向一次性形状保持压缩算法的统一框架。我们将 NoWag 应用于压缩 Llama-2(7B、13B、70B)和 Llama-3(8B、70B)模型,采用两种流行的形状保持技术:向量量化(NoWag-VQ)和非结构化/半结构化剪枝(NoWag-P)。我们的结果表明,NoWag-VQ 在一次性向量量化方法中显著优于最新技术,而 NoWag-P 则在领先剪枝技术中表现出竞争力。这些发现揭示了这些压缩范式之间的潜在共性,并为未来研究指明了有前景的方向。我们的代码已公开于 https://github.com/LawrenceRLiu/NoWag

关键词

引用

@article{arxiv.2504.14569,
  title  = {NoWag: A Unified Framework for Shape Preserving Compression of Large Language Models},
  author = {Lawrence Liu and Inesh Chakrabarti and Yixiao Li and Mengdi Wang and Tuo Zhao and Lin F. Yang},
  journal= {arXiv preprint arXiv:2504.14569},
  year   = {2026}
}