中文

通过在随机世界中的元训练实现大规模原地强化学习

机器学习 2025-11-04 v4 人工智能

摘要

原地强化学习 (ICRL) 使智能体能够自动且实时地从其交互经验中学习。然而,扩大ICRL规模的主要挑战在于缺乏可扩展的任务集合。为此,我们提出了名为AnyMDP的程序化生成的表格型马尔可夫决策过程。通过精心设计的随机化过程,AnyMDP能够在保持相对低结构偏差的同时,以大规模方式生成高质量任务。为促进大规模元训练,我们进一步引入了解耦的策略蒸馏,并在ICRL框架中引入先验信息。我们的结果表明,随着AnyMDP任务规模的足够增大,所提出的模型能够通过多样化的原地学习范例,泛化到训练集中未考虑的任务。AnyMDP提供的可扩展任务集也使我们能够更深入地探讨数据分布与ICRL性能之间的关系。我们进一步展示,ICRL的泛化可能以增加任务多样性和更长的适应时间为代价。这一发现对扩大健壮ICRL能力具有重要意义,突显了需要多样且广泛的任务设计,以及优先考虑渐进性能而非少样适应性的必要性。

关键词

引用

@article{arxiv.2502.02869,
  title  = {Towards Large-Scale In-Context Reinforcement Learning by Meta-Training in Randomized Worlds},
  author = {Fan Wang and Pengtao Shao and Yiming Zhang and Bo Yu and Shaoshan Liu and Ning Ding and Yang Cao and Yu Kang and Haifeng Wang},
  journal= {arXiv preprint arXiv:2502.02869},
  year   = {2025}
}

备注

NeruIPS 2025