HISR:基于 hindsight 信息调制分段过程奖励的多回合 agentic 强化学习
机器学习
2026-03-20 v1 人工智能
计算与语言
摘要
虽然大型语言模型在多个领域表现优异,但在复杂长期 agentic 决策任务上仍受限。大多数现有方法集中于设计有效的奖励模型 (RM) 以通过多回合强化学习推进性能。然而,这些方法受到稀疏结果奖励延迟传播和可能过于细粒度、不够聚焦的回合级过程奖励导致的信用分配不可靠问题。本文提出了 (HISR) 利用 hindsight 信息调制分段过程奖励的方法,这与子目标紧密对齐,并强调重要分段以增强信用分配的可靠性。具体而言,提出一种分段级别的过程 RM,用于为任务中的每个子目标分配奖励,避免过于细粒度地分配到回合。为强调轨迹中的重要分段,设计了一个 hindsight 模型来反映在了解轨迹结果后执行某些动作的偏好。凭借这一特性,我们设计了序列概率比值(hindsight 与 policy 模型之间的比值)来衡量动作重要性。随后,这些比值被用于聚合分段重要性得分,以此调制分段过程奖励,从而增强信用分配的可靠性。在三个公开基准上的大量实验结果表明,我们方法的有效性。
关键词
引用
@article{arxiv.2603.18683,
title = {HISR: Hindsight Information Modulated Segmental Process Rewards For Multi-turn Agentic Reinforcement Learning},
author = {Zhicong Lu and Zichuan Lin and Wei Jia and Changyuan Tian and Deheng Ye and Peiguang Li and Li Jin and Nayu Liu and Guangluan Xu and Wei Feng},
journal= {arXiv preprint arXiv:2603.18683},
year = {2026}
}
备注
Submitted to ACL 2026 on Jan 5, 2026