中文

通过联合优化世界-动作模型实现离线模型基强化学习的规模化

机器学习 2026-01-30 v4 人工智能

摘要

离线强化学习的一个重要目标是开发出能够从大规模且异构数据集中获得高性能的通用智能体。然而,现有方法要么严重依赖专家轨迹,要么在面对多样化的未见任务时难以有效泛化。灵感来源于条件视频生成中世界模型的优异泛化能力,我们探索基于图像观测的世界模型用于扩大离线强化学习规模并提升对新任务的泛化性。在本文中,我们引入JOWA:联合优化世界-动作模型(Jointly-Optimized World-Action model),这是一个在包含60亿数据标记的多个Atari游戏上预训练的离线模型基强化学习智能体,用于学习通用表征和决策能力。我们的 метод通过共享的Transformer骨干网络联合优化世界-动作模型,在预训练期间稳定了使用大规模模型时的时序差分学习。此外,我们提出一种可证明高效且可并行的规划算法,以补偿Q值估计误差,从而搜索出更好的策略。实验结果表明,我们最大的智能体(参数化1.5亿)仅使用10%抽样离线数据,即可在预训练游戏上实现78.9%的人类水平性能,平均性能比现有最先进的大规模离线强化学习基线提高31.6%。此外,JOWA随模型容量呈正比例增长,并能在仅需每款游戏5000条离线微调数据(约4条轨迹)的情况下,对新游戏进行高效的样本迁移,显示出卓越的泛化能力。我们将在https://github.com/CJReinforce/JOWA发布代码和模型权重。

关键词

引用

@article{arxiv.2410.00564,
  title  = {Scaling Offline Model-Based RL via Jointly-Optimized World-Action Model Pretraining},
  author = {Jie Cheng and Ruixi Qiao and Yingwei Ma and Binhua Li and Gang Xiong and Qinghai Miao and Yongbin Li and Yisheng Lv},
  journal= {arXiv preprint arXiv:2410.00564},
  year   = {2026}
}

备注

Accepted by ICLR 2025