中文

分位数优势估计:稳定面向 LLM 推理的 RLVR

机器学习 2026-03-03 v2 人工智能

摘要

带有可验证奖励的强化学习 (RLVR) 增强了 LLM 推理能力,但训练过程常在{熵塌缩}与{熵爆炸}之间振荡。我们将这两种危害均追溯至无价值强化学习 (例如 GRPO 和 DAPO) 中使用的均值基线,该基线在奖励离群点存在时对负优势样本施加了不当惩罚。我们提出{分位数优势估计} (QAE),以分组 K-分位数基线替代均值。QAE 引入了一个响应级别的双状态门控:对于困难查询 (p <= 1 - K),它强化罕见成功;而对于简单查询 (p > 1 - K),它针对剩余失败。在 softmax 一阶更新下,我们证明了{双侧熵安全性},给出了单步熵变化的上下界,以抑制爆炸并防止塌缩。实验表明,这一极小修改稳定了熵,稀疏化了信用分配 (在调优 K 后,约 80% 的响应获得零优势),并在 AIME 2024/2025 和 AMC 2023 上为 Qwen3-8B/14B-Base 带来了持续的 pass@1 提升。这些结果确认{基线设计}——而非 token 级启发式方法——是扩展 RLVR 的核心机制。

关键词

引用

@article{arxiv.2509.22611,
  title  = {Quantile Advantage Estimation: Stabilizing RLVR for LLM Reasoning},
  author = {Junkang Wu and Kexin Huang and Jiancan Wu and An Zhang and Xiang Wang and Xiangnan He},
  journal= {arXiv preprint arXiv:2509.22611},
  year   = {2026}
}