量化对大规模强推理模型强化学习的影响
机器学习
2025-11-20 v1
摘要
强大的推理能力现在可以通过大规模强化学习 (RL) 实现,无需任何监督微调。尽管 post-training 量化 (PTQ) 和量化感知训练 (QAT) 在微调背景下已被广泛研究,但如何量化影响大规模推理模型 (LRM) 中的 RL 仍是一个未解决的问题。为了回答这个问题,我们进行了系统实验,发现了 RL 量化后模型在数学基准测试上存在与其量化感知 RL 优化后模型之间的显著性能差距。我们的发现表明,量化感知 RL 训练对学习过程产生了负面影响,而 PTQ 和 QLoRA 表现更好。
引用
@article{arxiv.2511.15694,
title = {The Impact of Quantization on Large Reasoning Model Reinforcement Learning},
author = {Medha Kumar and Zifei Xu and Xin Wang and Tristan Webb},
journal= {arXiv preprint arXiv:2511.15694},
year = {2025}
}
备注
Accepted to the NeurIPS 2025 Efficient Reasoning Workshop