中文

基于终身世界模型的持续视觉强化学习

机器学习 2025-07-08 v2 计算机视觉与模式识别

摘要

在一系列非平稳环境中学习物理动态是基于视觉的模型强化学习(MBRL)的一项具挑战性但至关重要的任务。它要求智能体持续适应新任务而不遗忘已有知识。本文提出一种用于视觉动态建模的新型持续学习方法,并探究其在视觉控制中的效用。核心假设是:理想的世界模型可提供无遗忘的环境模拟器,使智能体能基于世界模型生成的想象轨迹以多任务学习方式优化策略。为此,我们首先引入终身世界模型,其使用高斯混合学习任务特定的潜在动态,并融合生成式经验回放以缓解灾难性遗忘。随后,我们进一步通过探索-保守行为学习方法解决以往任务的价值估计难题。在具备持续视觉控制任务的 DeepMind Control Suite 与 Meta-World 基准上,我们的模型显著优于现有持续学习与视觉 RL 算法的直接组合。

关键词

引用

@article{arxiv.2303.06572,
  title  = {Continual Visual Reinforcement Learning with A Life-Long World Model},
  author = {Minting Pan and Wendong Zhang and Geng Chen and Xiangming Zhu and Siyu Gao and Yunbo Wang and Xiaokang Yang},
  journal= {arXiv preprint arXiv:2303.06572},
  year   = {2025}
}

备注

Accepted by ECML 2025