语言智能体策略与内部奖励的共演化
机器学习
2026-04-06 v1 人工智能
计算与语言
摘要
大型语言模型(LLM)智能体通过与环境交互来学习,但长期程度训练受限于稀疏且延迟的奖励。现有方法通常通过事后信用分配或外部奖励模型来解决这一挑战,这些方法在推理时提供有限的指导,且常将奖励改进与策略改进分离。我们提出了 Self-Guide,一种用于语言智能体的自生成内部奖励,支持推理时指导和训练时监督。具体而言,智能体将 Self-Guide 作为自我指导信号,用于引导下一动作的推理过程,并将相同的信号转换为训练期间用于更密集策略优化的步骤级内部奖励。这形成了一个共演化的循环:更好的策略产生更好的指导,更好的指导进一步通过内部奖励改进策略。我们在三个智能体基准测试中进行实验,推理时的自我指导已显示出明显的提升,而通过 GRPO 联合演化策略和内部奖励的做法相较于仅使用环境奖励训练的基线提升了 8%。总体而言,我们的结果表明,语言智能体不仅可以通过收集更多经验来改进,还可以通过在行动和学习期间学习生成和细化自身内部奖励来实现提升。
引用
@article{arxiv.2604.03098,
title = {Co-Evolution of Policy and Internal Reward for Language Agents},
author = {Xinyu Wang and Hanwei Wu and Jingwei Song and Shuyuan Zhang and Jiayi Zhang and Fanqi Kong and Tung Sum Thomas Kwok and Xiao-Wen Chang and Yuyu Luo and Chenglin Wu and Bang Liu},
journal= {arXiv preprint arXiv:2604.03098},
year = {2026}
}
备注
20 pages, 13 figures