强化学习能否提高大语言模型代理的泛化能力?一项实证研究
人工智能
2026-03-13 v1
摘要
强化微调(RFT)已显示出通过环境反馈训练多回合决策的 LLM 代理具有潜力。然而,大多数现有评估仍主要停留在领域内:训练和测试在同一环境中甚至同一任务中进行。在实际部署中,代理可能在与之不同的环境中运行,涉及不同的背景知识、观察空间和行动接口。为刻画 RFT 在此类迁移下的泛化轮廓,我们沿三个维度开展了系统性研究:(1)在任务难度上进行的环境内泛化;(2)对未见环境的跨环境迁移;(3)顺序多环境训练以量化迁移与遗忘。我们的结果表明,RFT 在环境内的任务难度上具有良好的泛化能力,但在面对未见环境时迁移较弱,这与语义先验和观察/动作接口的变化相关。在 contrast下,顺序训练在保持最少上游遗忘的同时,为下游带来了有前景的收益,跨环境混合训练可提高整体平衡。我们进一步提供了详细分析和深入见解,希望我们的工作能帮助社区开发和部署通用 LLM 代理。
引用
@article{arxiv.2603.12011,
title = {Can RL Improve Generalization of LLM Agents? An Empirical Study},
author = {Zhiheng Xi and Xin Guo and Jiaqi Liu and Jiazheng Zhang and Yutao Fan and Zhihao Zhang and Shichun Liu and Mingxu Chai and Xiaowei Shi and Yitao Zhai and Xunliang Cai and Tao Gui and Qi Zhang and Xuanjing Huang},
journal= {arXiv preprint arXiv:2603.12011},
year = {2026}
}
备注
Preprint, under review