TSR:面向LLM智能体多轮强化学习的轨迹搜索展开
人工智能
2026-05-20 v3 计算与语言
机器学习
摘要
大语言模型(LLM)的进步正推动着使用强化学习(RL)从跨任务的迭代、多轮交互中训练智能体的转变。然而,多轮RL仍然具有挑战性,因为奖励通常是稀疏或延迟的,并且环境可能是随机的。在这种机制下,朴素的轨迹采样会阻碍利用并导致模式坍缩。我们提出了TSR(轨迹搜索展开),这是一种训练时方法,它重新利用了测试时缩放的思想来改进每轮展开的生成。TSR执行轻量级的树状搜索,通过使用基于状态的反馈在每轮选择高得分动作来构建高质量的轨迹。这提高了展开质量并稳定了学习,同时仍然与标准的策略梯度优化器兼容,使得TSR与优化器无关。我们使用最佳N、束搜索和浅层前瞻搜索实例化了TSR,并将其与PPO和GRPO配对,在Sokoban、FrozenLake和WebShop任务上实现了高达15%的性能提升和更稳定的学习,而训练计算量仅有一次适度的增加。通过将搜索从推理时间转移到训练的展开阶段,TSR为更强的多轮智能体学习提供了一种模块化和通用的机制,与现有框架和拒绝采样式选择方法互补。
引用
@article{arxiv.2602.11767,
title = {TSR: Trajectory-Search Rollouts for Multi-Turn RL of LLM Agents},
author = {Aladin Djuhera and Swanand Ravindra Kadhe and Farhan Ahmed and Syed Zawad and Heiko Ludwig and Holger Boche},
journal= {arXiv preprint arXiv:2602.11767},
year = {2026}
}