减少泛化代价:LLM 智能体强化学习训练的跨域泛化研究
人工智能
2026-01-27 v1 机器学习
摘要
通用 LLM 智能体通常在狭窄的环境集合上进行后训练,却被部署到远为广泛的未见领域中。在本文中,我们研究了当最终测试域未知时智能体后训练的挑战。具体而言,我们分析了强化学习(RL)环境和建模选择的哪些属性对域外性能的影响最大。首先,我们确定了两个与跨域泛化强相关的环境轴:(i)状态信息丰富度,即智能体从状态中处理的信息量;以及(ii)规划复杂度,通过基础策略下的目标可达性和轨迹长度来估计。值得注意的是,领域真实感和文本级相似性并非主要因素;例如,简单的网格世界域 Sokoban 在 SciWorld 中导致的泛化效果甚至比更真实的 ALFWorld 更强。受这些发现的启发,我们进一步表明,仅增加状态信息丰富度即可有效提高跨域鲁棒性。我们提出了一种低开销且广泛适用的随机化技术:向状态中添加少量与目标无关的干扰特征,在不改变任务的情况下使其更丰富。除了环境侧属性外,我们还考察了几种建模选择:(a)SFT 热身或中期训练有助于防止 RL 期间的灾难性遗忘,但会削弱对未包含在中期训练数据混合中的域的泛化能力;以及(b)在 RL 期间开启逐步思考,虽不总能提升域内性能,但在保持泛化能力方面起着至关重要的作用。
引用
@article{arxiv.2601.18217,
title = {Paying Less Generalization Tax: A Cross-Domain Generalization Study of RL Training for LLM Agents},
author = {Zhihan Liu and Lin Guan and Yixin Nie and Kai Zhang and Zhuoqun Hao and Lin Chen and Asli Celikyilmaz and Zhaoran Wang and Na Zhang},
journal= {arXiv preprint arXiv:2601.18217},
year = {2026}
}