中文

无需正确答案即可鼓励良好过程:用于 LLM 智能体规划的强化学习

机器学习 2025-08-28 v1

摘要

大语言模型(LLM)智能体的功能主要由两种能力决定:动作规划和答案总结。前者,即动作规划,是决定智能体表现的核心能力。然而,现有的训练范式采用端到端的多目标优化,联合训练两种能力。这一范式面临两个关键挑战:优化目标分配不平衡和可验证数据的稀缺,使得增强智能体的规划能力变得困难。为应对这些挑战,我们提出了基于工具使用奖励的强化学习(RLTR),一种新颖框架,将训练过程解耦以实现对规划模块的聚焦、单目标优化。关键的是,RLTR 引入了一种基于工具使用完整性的奖励信号,直接评估工具调用序列的质量。这种方法提供了比评估最终响应内容更直接可靠的训练信号,从而无需可验证数据。我们的实验表明,RLTR 相比端到端基线在规划性能上实现了 8%–12% 的提升。此外,这种增强的规划能力进而转化为整体智能体系统最终响应质量 5%–6% 的提升。

关键词

引用

@article{arxiv.2508.19598,
  title  = {Encouraging Good Processes Without the Need for Good Answers: Reinforcement Learning for LLM Agent Planning},
  author = {Zhiwei Li and Yong Hu and Wenqing Wang},
  journal= {arXiv preprint arXiv:2508.19598},
  year   = {2025}
}