中文

QaRL:面向训练-推理不匹配的快速稳定量化感知强化学习

机器学习 2026-04-10 v1 人工智能

摘要

大型语言模型 (LLM) 强化学习管道常因 rollout 生成成为瓶颈,导致端到端训练缓慢。最近的工作通过以量化方式运行 rollout 来缓解此问题,这是 RL 循环中最昂贵的阶段。然而,这些设置会通过放大训练-推理差距来 destabilize 优化:rollout 以低精度运行,而学习更新则以全精度计算。为此,我们提出了 QaRL (Rollout Alignment Quantization-Aware RL),以对齐训练侧前向传播与量化 rollout,以最小化不匹配。我们进一步识别了量化 rollout 中的一种失效模式:长形式响应倾向于产生重复、混乱的标记 (error tokens)。为缓解这些问题,我们引入了 TBPO (Trust-Band Policy Optimization),一种具有双重裁剪的序列级目标,旨在将更新保持在信任区域内。在用于数学问题的 Qwen3-30B-A3B MoE 上,QaRL 在量化-rollout 训练上 outperform +5.5,同时提高稳定性并保留低位吞吐量优势。

关键词

引用

@article{arxiv.2604.07853,
  title  = {QaRL: Rollout-Aligned Quantization-Aware RL for Fast and Stable Training under Training--Inference Mismatch},
  author = {Hao Gu and Hao Wang and Jiacheng Liu and Lujun Li and Qiyuan Zhu and Bei Liu and Binxing Xu and Lei Wang and Xintong Yang and Sida Lin and Sirui Han and Yike Guo},
  journal= {arXiv preprint arXiv:2604.07853},
  year   = {2026}
}