中文

量化对推理有何影响?——量化推理模型的实证研究

计算与语言 2025-08-19 v2 人工智能

摘要

近期推理语言模型的进展在复杂任务中展现出惊人的性能,但其扩展的链式思维推理过程增加了推理开销。虽然量化已被广泛采用以降低大型语言模型的推理成本,但其对推理模型的影响仍未得到充分研究。在本文中,我们对量化推理模型进行首次系统性研究,评估了开源 DeepSeek-R1-Distilled Qwen 和 LLaMA 系列模型(参数规模从 1.5B 到 70B)、QwQ-32B 和 Qwen3-8B。我们的研究涵盖权重、KV 缓存和激活量化,使用不同比特宽度的领先算法,并在数学 (AIME, MATH-500)、科学 (GPQA) 和编程 (LiveCodeBench) 等推理基准上进行广泛评估。我们的发现表明,虽然可实现无损量化(W8A8 或 W4A16 量化),但更低的比特宽度会引入显著的精度风险。我们进一步识别出模型规模、模型来源和任务难度是性能的关键决定因素。与预期相反,量化模型并未表现出增加输出长度的现象。此外, strategically 扩大模型规模或推理步骤可有效提升性能。所有量化模型和代码均开源于 https://github.com/ruikangliu/Quantized-Reasoning-Models。

关键词

引用

@article{arxiv.2504.04823,
  title  = {Quantization Hurts Reasoning? An Empirical Study on Quantized Reasoning Models},
  author = {Ruikang Liu and Yuxuan Sun and Manyi Zhang and Haoli Bai and Xianzhi Yu and Tiezheng Yu and Chun Yuan and Lu Hou},
  journal= {arXiv preprint arXiv:2504.04823},
  year   = {2025}
}

备注

COLM 2025