AT$^2$PO:基于树搜索的智能体回合制策略优化
人工智能
2026-01-09 v1 计算与语言
摘要
LLM 智能体通过交替进行内部推理和外部工具交互,已成为处理多轮任务的强大系统。智能体强化学习作为一种关键的后训练范式,最近引起了广泛的研究关注,以进一步完善这些能力。在本文中,我们提出了 ATPO(基于树搜索的智能体回合制策略优化,Agentic Turn-based Policy Optimization via Tree Search),这是一个用于多轮智能体强化学习的统一框架,解决了三个核心挑战:有限的探索多样性、稀疏信用分配和策略优化不对齐。ATPO 引入了回合级树结构,共同实现了用于策略性探索的熵引导树扩展和用于从稀疏结果中进行细粒度奖励传播的回合制信用分配。作为补充,我们提出了智能体回合制策略优化,这是一个回合级学习目标,将策略更新与智能体交互的自然决策粒度相对齐。ATPO 与树搜索正交,可以轻松集成到任何多轮强化学习流程中。在七个基准上的实验表明,与最先进的基线相比,平均持续改进高达 1.84 个百分点,消融研究验证了每个组件的有效性。我们的代码可在 https://github.com/zzfoutofspace/ATPO 获取。
引用
@article{arxiv.2601.04767,
title = {AT$^2$PO: Agentic Turn-based Policy Optimization via Tree Search},
author = {Zefang Zong and Dingwei Chen and Yang Li and Qi Yi and Bo Zhou and Chengming Li and Bo Qian and Peng Chen and Jie Jiang},
journal= {arXiv preprint arXiv:2601.04767},
year = {2026}
}