并非所有评分标准都等价:基于策略的POW3R评分奖励用于RLVR
人工智能
2026-05-20 v1
摘要
基于可验证奖励的强化学习在正确性可自动检查的情境下后训练效果显著。然而,许多重要模型行为需要同时满足多个定性标准。基于评分标准的奖励通过对提示特定的标准进行评分并聚合为标量奖励来解决这一问题。然而,标准的静态聚合会将准则的人工分配重要性与其作为优化信号的当前有用性混为一谈。我们展示了在评分标准RL中,这一假设不成立:许多重要准则已经饱和或当前不可达,而那些区分 rollout 的准则未必具有最大的人工权重。我们引入POW3R,一个在策略上感知的评分奖励框架,既保留人工权重和类别平衡作为评分目标,又在训练期间适应准则级别的奖励权重。POW3R使用 rollout 级别的对比来强调当前分离策略输出的准则,使GRPO奖励更具信息性而不改变 underlying 评估目标。在两个数据集上覆盖多模态和文本唯一设置的三个基础策略中,POW3R在30个基线策略/指标比较中赢得24个,在vanilla GRPO带评分奖励的情况下改进了平均评分奖励和严格完成率(满足每个必需评分准则的提示比例),并且在2.5-4倍较少的训练步骤中达到相同的平台。因此,评分奖励应将应在最终答案中何为重要的事与当前策略可教授的事区分开来。
引用
@article{arxiv.2605.20164,
title = {Not Every Rubric Teaches Equally: Policy-Aware Rubric Rewards for RLVR},
author = {Utkarsh Tyagi and Xingang Guo and MohammadHossein Rezaei and Daniel George and Anas Mahmoud and Jackson Lee and Bing Liu and Yunzhong He},
journal= {arXiv preprint arXiv:2605.20164},
year = {2026}
}
备注
24 pages, 7 figures, 6 tables