通过跨回合元强化学习扩放 LLM 内在在线学习能力
人工智能
2026-02-05 v1 计算与语言
机器学习
摘要
大型语言模型(LLM)在所有任务相关信息可用于静态预测和指令遵循问题时表现突出。然而,许多实际决策任务本质上是在线进行的:关键信息必须通过交互获取,反馈延迟,有效行为需要在信息收集与开发动作之间进行平衡。虽然内在学习使模型无需权重更新即可适应,但现有 LLM 往往难以可靠地在此类设置下利用内在交互经验。在本工作中,我们展示了可以通过训练来解决这一限制。我们提出ORBIT框架,这是一种多任务、多回合元强化学习方法,用于训练 LLM 从交互中学习。在元训练后,一个相对较小的开源模型(Qwen3-14B)在完全未见的环境中展现出显著改善的内在在线学习能力,甚至匹配GPT-5.2的性能,并大幅超过标准RL微调。规模化实验进一步揭示了模型规模提升带来持续收益,表明在推断时学习的决策代理仍有显著的提升空间。论文中结果的复现代码可在 https://github.com/XiaofengLin7/ORBIT 查阅。
引用
@article{arxiv.2602.04089,
title = {Scaling In-Context Online Learning Capability of LLMs via Cross-Episode Meta-RL},
author = {Xiaofeng Lin and Sirou Zhu and Yilei Chen and Mingyu Chen and Hejian Sang and Ioannis Paschalidis and Zhipeng Wang and Aldo Pacchiano and Xuezhou Zhang},
journal= {arXiv preprint arXiv:2602.04089},
year = {2026}
}