中文

OSAQ:用于精确低比特 LLM 量化的离群值自吸收

机器学习 2026-05-12 v2

摘要

大型语言模型(LLM)展现出了卓越的能力。然而,其庞大的参数规模导致推理过程中产生显著的资源消耗和延迟。仅权重的训练后量化通过减少模型大小并通过缓解内存受限问题来加速 token 生成,提供了一种有前景的解决方案。然而,权重中固有的系统性离群值的存在仍然是一个主要障碍。尽管现有方法(如缩放和旋转)试图解决这一问题,但性能仍不能令人满意。在本文中,我们提出了离群值自吸收量化(OSAQ),它针对 LLM 的低比特仅权重量化,在二阶低秩属性的指导下执行加法权重抑制。具体而言,我们观察到 Hessian 矩阵在不同输入间表现出低秩一致性,某些方向持续显示出消失的曲率。利用这一属性,我们识别出 Hessian 矩阵的一个稳定零空间,然后通过线性组合该零空间内的向量来构建加法权重转换,从而在不影响任务损失的情况下抑制权重离群值。这种加法转换可以离线吸收到权重中,无需层间转换,且不引入推理开销。此外,该构造通过闭式解高效实现,无需资源密集型的训练或迭代过程。大量实验表明,OSAQ 有效抑制了离群值并增强了低比特量化性能。例如,在 2 比特量化中,OSAQ 与 GPTQ 结合时,相比原始 GPTQ 实现了超过 40% 的困惑度降低。

关键词

引用

@article{arxiv.2605.04738,
  title  = {OSAQ: Outlier Self-Absorption for Accurate Low-bit LLM Quantization},
  author = {Zhikai Li and Zhen Dong and Xuewen Liu and Jing Zhang and Qingyi Gu},
  journal= {arXiv preprint arXiv:2605.04738},
  year   = {2026}
}

备注

ICML 2026