Rubrics as Rewards:超越可验证领域的强化学习
机器学习
2025-10-06 v2 人工智能
计算与语言
摘要
基于可验证奖励的强化学习(RLVR)已被证明对于具有明确正确性信号的数学和编码等复杂推理任务效果良好。然而,由于评估依赖于细微的、多标准的判断而非二进制正确性,将其扩展到实际场景推理任务具有挑战性。实例特定的评分标准(rubrics)近期被用于评估基准以捕捉此类判断,但其作为基于策略的后训练奖励信号的潜力仍未得到充分探索。我们引入Rubrics as Rewards(RaR),一种基于策略的强化学习方法,通过使用评分标准反馈将RLVR扩展到不可验证的领域。在医疗和科学领域,我们评估了将评分标准反馈聚合为奖励的多种策略。最佳RaR变体在HealthBench上实现最高31%的相对提升,在GPQA-Diamond上实现最高7%的相对提升,显著超过依赖直接Likert-based奖励的流行LLM-as-judge基线。这些结果表明,RaR训练的策略对多种评估格式都能有效适应,在评分标准和多选题任务中均表现强劲。此外,我们发现将评分标准作为结构化奖励信号用于较小的评判器可获得更好的对齐效果,并降低了评判器规模之间的性能波动。
引用
@article{arxiv.2507.17746,
title = {Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains},
author = {Anisha Gunjal and Anthony Wang and Elaine Lau and Vaskar Nath and Yunzhong He and Bing Liu and Sean Hendryx},
journal= {arXiv preprint arXiv:2507.17746},
year = {2025}
}
备注
preprint