中文

大语言模型基于组的量化的两阶段网格优化

机器学习 2026-02-03 v1 人工智能

摘要

基于组的量化是缓解大语言模型(LLM)低位量化中准确性下降的有效策略。在现有方法中,GPTQ 因其高效性而被广泛采用;然而,它在确定组尺度时忽略了输入统计信息和组间相关性,导致其目标(最小化层级重构损失)与实际效果存在偏差。本文提出了一个用于组尺度的两阶段优化框架,以显式最小化层级重构损失为目标。在第一阶段,针对 GPTQ 之前,对每个组的尺度进行初始化,以最小化组间重构损失,从而纳入输入统计信息。在第二阶段,我们冻结通过 GPTQ 获取的整数权重,并优化组尺度以最小化层级重构损失。为此,我们采用坐标下降算法并推导出闭式更新规则,这使得在不进行高成本数值优化的情况下能够高效地进行细化。值得注意的是,我们的推导包含了前几层的量化误差,以防止误差累积。实验结果表明,我们的方法在组基于量化方面始终能实现更高的准确性,且几乎没有额外开销。

关键词

引用

@article{arxiv.2602.02126,
  title  = {Two-Stage Grid Optimization for Group-wise Quantization of LLMs},
  author = {Junhan Kim and Gukryeol Lee and Seungwoo Son and Jeewook Kim and Yongkweon Jeon},
  journal= {arXiv preprint arXiv:2602.02126},
  year   = {2026}
}

备注

ICASSP 2026