面向多目标强化学习的块级优势估计:可验证奖励的实现方法
机器学习
2026-02-12 v1 人工智能
计算与语言
摘要
组相对策略优化(GRPO)为 completion 中的所有标记分配单个标量优势。对于具有显式分段和目标的结构生成,这会导致跨分段之间不相关的奖励信号耦合,引发目标干扰和信用归因错误。我们提出块级优势估计(Blockwise Advantage Estimation),这是一系列GRPO兼容方法,为每个目标分配自己的优势并仅将其应用到相应文本块中的标记上,减少对手工设计的标量奖励依赖,同时自然扩展到额外的目标。关键挑战在于估计其奖励取决于已抽样前缀的后续块的优势;标准无偏方法需要从中间状态进行昂贵的嵌套 rollout。具体而言,我们引入一种以结果为条件的基线(Outcome-Conditioned Baseline),通过对根据前缀派生的中间结果对样本进行分层抽样来仅使用组内统计信息来近似中间状态的值。在具有不确定性估计的数学任务上,我们的方法缓解了奖励干扰,与最新方法的奖励设计方法相当,并保留了来自置信度加权集成的测试时收益。更广泛地说,它为在结构化生成中优化顺序目标提供了一种模块化的配方,无需额外的 rollout。
引用
@article{arxiv.2602.10231,
title = {Blockwise Advantage Estimation for Multi-Objective RL with Verifiable Rewards},
author = {Kirill Pavlenko and Alexander Golubev and Simon Karasik and Boris Yangel},
journal= {arXiv preprint arXiv:2602.10231},
year = {2026}
}