反思引导的策略优化:轨迹 grounding 修订与显著性偏差
摘要
现有的 LLM 基于策略优化器仅看到标量奖励:即某个策略得了 0.45,但看不到代理在第 3 步陷入循环、掉进洞穴,还是在 19 次 rollout 中表现良好仅在一次 catastrophic failure。我们提出了反思引导策略优化(Reflective Prompted Policy Optimization, R2PO),一个针对紧凑策略类别的策略搜索的两阶段 LLM 框架,增强了来自轨迹水平行为证据的标量奖励反馈。Search-LLM 提出候选策略参数;环境执行它们;Critic-LLM 检查 resulting rollouts 并在所观察到的状态、动作和奖励基础上提出针对性的修订。在十个环境中的消融实验表明,R2PO 的提升需要将全局搜索与行为 grounding 修订分离,并使用选择来筛选高方差的编辑。我们进一步识别出一种主导性失败模式,即显著性偏差:当面对多个 rollout 时,Critic-LLM 会聚焦于改进单个 failure,即使大多数轨迹都成功。在一个包含三条轨迹的变体中,Critic-LLM 只看到最佳、最差和中位数 rollout,此行为解释了在 CartPole 上发生 76.6% 的回归。R2PO 通过推理 aggregate rollout 统计、中位数轨迹选择以及一种修订规则来缓解这一问题。使用 20B 大型开源模型,R2PO 在所有十个环境中实现了最高的平均最佳奖励,大幅提前接近最优性能(例如,在约 500 回合内接近 CartPole 最高奖励),并比深度强化学习和此前基于 LLM 的方法更稳定地训练。这些结果表明,将轨迹作为一线 in-context 证据来处理,而不是简化为标量返回的惩罚,改变了即使是相对较小的 LLM 如何在策略空间中搜索的方式,使其能够更快学习、更精确诊断,并可靠地改进外部控制器。
引用
@article{arxiv.2605.08315,
title = {Reflective Prompted Policy Optimization: Trajectory-Grounded Revision and Salience Bias},
author = {Rahaf Abu Hara and Vaibbhav Murarri and Claudio Zito},
journal= {arXiv preprint arXiv:2605.08315},
year = {2026}
}