无需正确答案即可鼓励良好过程:用于 LLM 智能体规划的强化学习
机器学习
2025-08-28 v1
摘要
大语言模型(LLM)智能体的功能主要由两种能力决定:动作规划和答案总结。前者,即动作规划,是决定智能体表现的核心能力。然而,现有的训练范式采用端到端的多目标优化,联合训练两种能力。这一范式面临两个关键挑战:优化目标分配不平衡和可验证数据的稀缺,使得增强智能体的规划能力变得困难。为应对这些挑战,我们提出了基于工具使用奖励的强化学习(RLTR),一种新颖框架,将训练过程解耦以实现对规划模块的聚焦、单目标优化。关键的是,RLTR 引入了一种基于工具使用完整性的奖励信号,直接评估工具调用序列的质量。这种方法提供了比评估最终响应内容更直接可靠的训练信号,从而无需可验证数据。我们的实验表明,RLTR 相比端到端基线在规划性能上实现了 8%–12% 的提升。此外,这种增强的规划能力进而转化为整体智能体系统最终响应质量 5%–6% 的提升。
引用
@article{arxiv.2508.19598,
title = {Encouraging Good Processes Without the Need for Good Answers: Reinforcement Learning for LLM Agent Planning},
author = {Zhiwei Li and Yong Hu and Wenqing Wang},
journal= {arXiv preprint arXiv:2508.19598},
year = {2025}
}