AAAC:基于激活感知的自适应码book用于 4 位 LLM 权重量化
机器学习
2026-05-12 v1 计算与语言
摘要
后训练权重仅量化至 4 位是大语言模型推理中降低内存和计算成本的常用方法。现有 PTQ 方法,如 AWQ 和 GPTQ,通过缩放、裁剪或误差补偿改进权重映射至固定 4 位网格的方式。为进一步提升精度,OmniQuant 和 QuIP# 等方法使用梯度辅助算法,代价为数小时的量化时间。本文提出 AAAC(Activation-Aware Adaptive Codebooks),一种用于 4 位 LLM 权重量化的轻量级方法。AAAC 将标准量化中固定标量码book替换为每个层的两个小型可学习标量码book(各 64 字节)。每组权重选择能最小化激活加权重建误差的码book,并将选择编码于该组正比例尺的未使用符号位中,无需额外存储开销。AAAC 在单 GPU 上完成耗时 3–30 分钟,仅需模型本身的存储空间。我们在多个模型家族上对比评估 AWQ、GPTQ、IF4、GPTVQ、OmniQuant、SqueezeLLM 和 QuIP#。AAAC 在量化时间上优于基线方法数个数量级,同时实现更好的性能。
引用
@article{arxiv.2605.08692,
title = {AAAC: Activation-Aware Adaptive Codebooks for 4-bit LLM Weight Quantization},
author = {Beshr IslamBouli and David Jin},
journal= {arXiv preprint arXiv:2605.08692},
year = {2026}
}