中文

GlowQ: 用于量化大语言模型的组共享低秩近似

机器学习 2026-05-01 v2 人工智能

摘要

量化技术如BitsAndBytes、AWQ和GPTQ是部署大语言模型广泛使用的标准方法,但在使用低位表示(如4位)时通常会降低精度。低秩校正方法(如LQER、QERA、ASER)已被提出以缓解此问题,但它们恢复所有层并在每个解码器块中插入误差校正模块,从而增加了延迟和内存开销。为解决这一限制,我们提出了GlowQ,一种用于量化大语言模型的组共享低秩近似方法,它为每个输入共享组缓存一个共享的右因子,并且仅恢复那些带来最高精度增益的组或层。GlowQ为每个输入共享组计算一次高精度投影并在其模块间复用,减少了参数和内存开销,同时保留了层特定校正的表达能力。我们还提出了一种选择性变体GlowQ-S,仅在它提供最大增益的位置应用缓存的共享模块。与强基线相比,我们的方法平均将TTFB降低(5.6%),吞吐量提高(9.6%),同时在WikiText-2上的困惑度降低(0.17%),下游准确率提高0.42个百分点。选择性模型GlowQ-S进一步降低了延迟,将TTFB降低(23.4%),吞吐量提高(37.4%),同时平均准确率保持在0.2个百分点以内。代码可在https://github.com/ahnselim/GlowQ获取。

关键词

引用

@article{arxiv.2603.25385,
  title  = {GlowQ: Group-Shared LOw-Rank Approximation for Quantized LLMs},
  author = {Selim An and Il hong Suh and Yeseong Kim},
  journal= {arXiv preprint arXiv:2603.25385},
  year   = {2026}
}