中文

RL 后训练的引导式混合奖励:注入规范动作顺序

机器学习 2026-05-06 v3 人工智能

摘要

强化学习(RL)后训练通常针对单一标量目标进行优化,忽略解决方案产生方式中的结构。我们询问是否可以使用规范求解器顺序的稀疏提示,在RL后训练期间仅用于此目的,即使在随机化解序列上进行微调,也能提高性能。在Zebra拼图上,我们对Transformer在随机化解序数上进行微调,然后使用Group Relative Policy Optimization(GRPO)进行后训练,采用两种奖励:稀疏任务奖励仅在拼图完全解决时为1,排序奖励随模型发射顺序与规范求解顺序对齐而增大。为干净地比较信号,我们通过固定混合并使用简单的引导式缩放在初始化时等化各分量的大小。混合奖励通常优于仅任务优化,表明粗糙的排序信号可引导RL后训练趋向规范轨迹,而无需修改监督数据或架构。

关键词

引用

@article{arxiv.2512.04277,
  title  = {Bootstrapped Mixed Rewards for RL Post-Training: Injecting Canonical Action Order},
  author = {Prakhar Gupta and Vaibhav Gupta},
  journal= {arXiv preprint arXiv:2512.04277},
  year   = {2026}
}