折扣 Beta-Bernoulli 奖励估计:用于可验证奖励的样本高效强化学习
机器学习
2026-05-26 v2 人工智能
摘要
可验证奖励的强化学习 (RLVR) 已成为提高大型语言模型推理能力的有效后训练范式。然而,现有的基于群组的 RLVR 方法常 suffer 严重的样本低效。这一低效性源于依赖少量 rollout 的奖励点估计,导致估计方差高、方差坍缩以及对生成响应的无效利用。在本工作中,我们从统计估计视角重新构建 RLVR,通过将奖励建模为从由策略诱导的分布中抽取的样本,并将优势计算作为从有限数据估计奖励分布的问题。基于此视角,我们提出折扣 Beta-Bernoulli (DBB) 奖励估计,利用历史奖励统计量处理非平稳分布。尽管存在偏差,该估计器表现出降低且稳定的方差,理论上避免估计方差坍缩,并在标准点估计中实现更低的均方误差。在六项分布内和三项分布外的推理基准上进行的大量实验表明,带 DBB 的 GRPO consistently 优于朴素 GRPO,在 1.7B 和 8B 模型上分别在分布内平均 Acc@8 提升 3.22/2.42 分,分布外提升 12.49/6.92 分,且无需额外计算成本或内存占用。
关键词
引用
@article{arxiv.2603.18444,
title = {Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards},
author = {Haechan Kim and Soohyun Ryu and Gyouk Chu and Doohyuk Jang and Eunho Yang},
journal= {arXiv preprint arXiv:2603.18444},
year = {2026}
}
备注
14 pages, 3 figures