中文

迈向上下文强化学习中可证明的涌现

机器学习 2025-10-06 v2

摘要

通常,现代强化学习(RL)智能体通过更新神经网络参数来适应任务,从而解决该任务。最近观察到,一些 RL 智能体在某个任务分布上进行预训练后,无需参数更新即可解决大量分布外的新任务。在新任务中进行评估时,预训练智能体不对参数进行更新,而是将额外输入称为上下文的条件作用于其策略,例如智能体在新任务中的交互历史。随着上下文中信息的增加,智能体的性能随之提升,而智能体参数保持固定。这种现象通常被称为上下文强化学习(ICRL)。智能体网络的预训练参数使这一显著的 ICRL 现象成为可能。然而,许多 ICRL 工作使用标准 RL 算法进行预训练。这引出了本文旨在回答的核心问题:为什么 RL 预训练算法能够生成使 ICRL 成为可能的网络参数?我们假设具备 ICRL 能力的参数是预训练损失的极小值点。本工作通过案例研究为该假设提供了初步支持。具体而言,我们证明当 Transformer 被预训练用于策略评估时,预训练损失的一个全局极小值点可以使能上下文时序差分学习。

关键词

引用

@article{arxiv.2509.18389,
  title  = {Towards Provable Emergence of In-Context Reinforcement Learning},
  author = {Jiuqi Wang and Rohan Chandra and Shangtong Zhang},
  journal= {arXiv preprint arXiv:2509.18389},
  year   = {2025}
}

备注

NeurIPS 2025, 29 pages