中文

奖励信念而非行动:长程智能体的一致性引导信用分配

计算与语言 2026-05-20 v1

摘要

基于可验证奖励的强化学习 (RLVR) 是提升大语言模型 (LLM) 智能体在长程交互任务中表现的一种有前景的范式。然而,在部分可观测环境中,不完全的观测会导致智能体信念随时间漂移,而延迟的奖励则掩盖了中间决策的因果影响,加剧了时间信用分配的挑战。为了解决这个问题,我们提出了 ReBel (Reward Belief),一种过程级强化学习算法,该算法显式地对结构化的信念状态进行建模,以总结交互历史并指导后续的策略学习。ReBel 引入了信念一致性监督,将预测信念与观测反馈之间的差异转化为密集的自监督信号,无需外部逐步标注或验证器。它还采用信念感知分组来比较相似信念状态下的轨迹,从而产生更稳健、方差更低的优势估计。我们在具有挑战性的长程基准测试 ALFWorld 和 WebShop 上评估了 ReBel。与回合级基线 GRPO 相比,ReBel 将任务成功率提高了高达 20.4 个百分点,并将样本效率提高了 2.1 倍。这些结果表明,信念感知的自监督是实现部分可观测条件下可靠长程决策的一个有前景的方向。代码可在 https://github.com/Fateyetian/Rebel.git 获取。

关键词

引用

@article{arxiv.2605.20061,
  title  = {Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents},
  author = {Wenjie Tang and Minne Li and Sijie Huang and Liquan Xiao and Yuan Zhou},
  journal= {arXiv preprint arXiv:2605.20061},
  year   = {2026}
}

备注

10 pages, 4 figures, 3 tables, plus appendix