中文

树状自纠正与移植:多轮智能体策略优化

人工智能 2026-04-16 v2 机器学习

摘要

大型语言模型智能体的强化学习常因稀疏奖励受多步推理任务的阻碍。现有方法如Group Relative Policy Optimization将采样轨迹视为独立链,为每个链中所有步骤分配统一信用,忽略关键步骤在推理结果中的非比例影响。本文提出T-STAR(Tree-structured Self-Taught Agent Rectification),一个框架用于恢复看似独立轨迹之间隐含的相关奖励结构。具体方法是将轨迹整合为统一的认知树,通过识别并合并功能相似的步骤/节点实现。使能Introspective Valuation机制,通过树状结构反向传播轨迹级奖励,以获得步骤级的方差降低的相对优势。基于认知树,我们还开发了In-Context Thought Grafting,通过对比关键分歧点/步骤处的成功与失败分支来合成纠正性推理。随后,我们的Surgical Policy Optimization通过Bradley-Terry形式的手术损失利用这些关键点/步骤处聚集的丰富策略梯度信息。广泛的实验在具身、交互、推理和规划基准上表明,T-STAR在强基线上实现持续改进,在需要延长推理链的任务上提升尤为显著。

关键词

引用

@article{arxiv.2604.07165,
  title  = {Reason in Chains, Learn in Trees: Self-Rectification and Grafting for Multi-turn Agent Policy Optimization},
  author = {Yu Li and Sizhe Tang and Tian Lan},
  journal= {arXiv preprint arXiv:2604.07165},
  year   = {2026}
}