中文

PORTool:基于奖励树的重要性感知政策优化,用于多工具集成推理

计算与语言 2026-05-04 v2 人工智能 机器学习

摘要

多工具集成推理使 LLM 驱动的工具使用智能体能够通过交错自然语言推理与对外部工具的调用来解决复杂任务。然而,仅凭结果级奖励训练此类智能体会受到信用分配的歧义,掩盖了哪些中间工具使用决策是成功还是失败的关键因素。在本文中,我们提出了 PORTool,一种重要性感知的政策优化算法,从结果级监督中强化智能体的工具使用能力,同时在步骤级别分配奖励。具体而言,PORTool 生成一个带奖励的 rollout 树,其中共享前缀的轨迹在分支前进行比较,使同一情境下可比较的备选工具使用决策能够直接对比。它随后通过一种以正确性为主导的信号来估计每个步骤的重要性,即该步骤的后代最终能否产生正确的最终答案,另外辅以该步骤的工具调用是否满足格式约束并成功执行的指示。利用这些步骤级重要性估计,PORTool 更新政策,以在每个分支决策内的局部比较以及整个轨迹质量方面为导向,生成高效的工具调用步骤。实验表明,PORTool 在提高最终答案准确率的同时,减少了工具调用步骤数,且消融研究确认了所提出的步骤级重要性估计的鲁棒性。

关键词

引用

@article{arxiv.2510.26020,
  title  = {PORTool: Importance-Aware Policy Optimization with Rewarded Tree for Multi-Tool-Integrated Reasoning},
  author = {Feijie Wu and Weiwu Zhu and Yuxiang Zhang and Soumya Chatterjee and Jiarong Zhu and Fan Mo and Rong Luo and Jing Gao},
  journal= {arXiv preprint arXiv:2510.26020},
  year   = {2026}
}