PhGPO:用于长时程工具规划的信息素引导策略优化
人工智能
2026-02-17 v1
摘要
大型语言模型 (LLM) 代理的最新进展展示了通过工具使用执行复杂任务的强大能力。然而,长时程多步骤工具规划具有挑战性,因为探索空间遭受组合爆炸。在这种情况下,即使找到了正确的工具使用路径,它通常也被视为当前训练的即时奖励,不会为后续训练提供任何可重用的信息。在本文中,我们认为历史上成功的轨迹包含可重用的工具转换模式,可以在整个训练过程中利用。受蚁群优化(历史上成功的路径可以通过信息素反映)的启发,我们提出了信息素引导策略优化 (PhGPO),它从历史轨迹中学习基于轨迹的转换模式(即信息素),然后使用学习到的信息素来指导策略优化。这种学习到的信息素提供了明确且可重用的指导,将策略优化引向历史上成功的工具转换,从而改进长时程工具规划。综合实验结果表明了我们提出的PhGPO的有效性。
引用
@article{arxiv.2602.13691,
title = {PhGPO: Pheromone-Guided Policy Optimization for Long-Horizon Tool Planning},
author = {Yu Li and Guangfeng Cai and Shengtian Yang and Han Luo and Shuo Han and Xu He and Dong Li and Lei Feng},
journal= {arXiv preprint arXiv:2602.13691},
year = {2026}
}