中文

量化遇上推理:探索与缓解低位 LLM 在数学推理中的性能下降

机器学习 2026-01-21 v4 人工智能

摘要

低位后训练量化(PTQ)是部署在严格内存和延迟预算下的推理能力 LLM 的实用方法,但会显著损害数学推理能力(在我们更具挑战性的场景中下降最高可达 69.81%)。我们以过程级精度回应两个部署关键问题:性能下降首先在何处出现?如何在低位范围内缓解?在广泛使用的 PTQ 方法(AWQ、GPTQ、SmoothQuant)、开源模型家族(Qwen、LLaMA;0.5--7B)以及数学推理基准(GSM8K、MATH、AIME)上,我们进行格式对齐的链式思维(chain-of-thought)分析,结合步骤对齐的归因分析,揭示了两项稳健规律:(i)PTQ 在高层概念错误之外,显著放大方法和执行错误;(ii)失败早于最终答案,第一个脆弱步骤会触发连锁反应。这些规律建议一种通用干预原则:在最早的失败前沿精确地恢复局部 token 级边际。我们将该原则实现为一种轻量级的 measure→locate→restore 循环,直接作用于量化模型:检测第一个有故障的步骤,构建我们的“银弹”数据集,并应用小规模的监督/偏好调优。在我们的实验设置中,仅需 332 个精心挑选的示例和 3--5 分钟的单 GPU 计算,即可在保持 PTQ 效率的同时,将 4 位权重的数学推理恢复到全精度基准水平。我们的框架在评估范围内对量化器和模型体系结构具有通用性,将低位降级从全局准确率问题转化为局部、可重复的过程干预。

关键词

引用

@article{arxiv.2505.11574,
  title  = {Quantization Meets Reasoning: Exploring and Mitigating Degradation of Low-Bit LLMs in Mathematical Reasoning},
  author = {Zhen Li and Yupeng Su and Songmiao Wang and Runming Yang and Congkai Xie and Aofan Liu and Ming Li and Jiannong Cao and Yuan Xie and Ngai Wong and Hongxia Yang},
  journal= {arXiv preprint arXiv:2505.11574},
  year   = {2026}
}

备注

27pages