中文

ADMM-Q:用于大型语言模型后训练量化的改进型 Hessian 基于权重量化器

机器学习 2026-05-13 v1

摘要

量化是减少大型语言模型(LLM)存储和计算占用的有效策略。后训练量化(PTQ)是压缩 LLM 的主要方法。包括 GPTQ 和 RTN 在内的流行权重量化程序在模型实用性方面存在不足,尤其是在激进的量化级别(低于 4 位)时。我们提出了 ADMM-Q,一种考虑层级量化问题的新型权重量化算法。该算法基于交替方向乘子法(ADMM)的组合变体。我们的分段算子更新程序持续更新权重以最小化层级重建误差,同时逐步施加量化约束并保证收敛。我们提出了额外的算法增强措施(如惩罚调度、预条件化以及局部搜索后处理步骤),以使 ADMM-Q 在 LLM 规模下具有效率。ADMM-Q 是模块化的,可作为现有量化管道中任何权重量化器的即插即用替换方案:ADMM-Q 完全可与现有技术兼容,包括范围裁剪、学习型或随机旋转以及激活缩放。在 Qwen3-8B 上替换 GPTQ 使用 ADMM-Q,可在以下情境中降低 WikiText-2 困惑度:(i) W3A16 仅量化设置下(12.85 → 10.06);(ii) W4A8 SmoothQuant 程序下(9.29 → 8.68);(iii) W2A4KV4 SpinQuant 程序下(66.11 → 19.42)。

关键词

引用

@article{arxiv.2605.11222,
  title  = {ADMM-Q: An Improved Hessian-based Weight Quantizer for Post-Training Quantization of Large Language Models},
  author = {Ryan Lucas and Mehdi Makni and Xiang Meng and Adam Deng and Rahul Mazumder},
  journal= {arXiv preprint arXiv:2605.11222},
  year   = {2026}
}