中文

LLM 联合量化与稀疏化的最优脑恢复

计算与语言 2025-09-16 v1 人工智能

摘要

最近的大语言模型(LLM)压缩技术,如量化和剪枝,已取得显著成功。然而,随着这些技术逐渐接近其各自的限制,仅依赖单一方法进行进一步压缩变得日益具有挑战性。本文通过结合量化和稀疏化探索了一种替代解决方案。这种联合方法虽然前景光明,但由于对权重分布的固有冲突要求(量化倾向于紧凑范围,而剪枝受益于高方差),引入了新的难题。为攻击此问题,我们提出了最优脑恢复(Optimal Brain Restoration, OBR),这是一种通用且无需训练的框架,通过两种方法之间的误差补偿来实现剪枝和量化的对齐。OBR 通过建立二阶 Hessian 目标函数来最小化下游任务的性能降低,该目标随后通过代理近似转化为可解问题,并最终通过组误差补偿达到闭式解。实验表明,OBR 使现有 LLM 实现激进的 W4A4KV4 量化并配合 50\% 稀疏度,相较于 FP16 稠密基准实现最高可达 4.72 倍加速和 6.4 倍内存降低。

关键词

引用

@article{arxiv.2509.11176,
  title  = {Differentially-private text generation degrades output language quality},
  author = {Erion Çano and Ivan Habernal},
  journal= {arXiv preprint arXiv:2509.11176},
  year   = {2025}
}

备注

20 pages, 3 figures, 35 tables