利用真实场景视频为强化学习预训练上下文化世界模型
计算机视觉与模式识别
2023-10-30 v2 机器学习
机器人学
摘要
利用大规模多样化数据的无监督预训练方法在多个领域取得了巨大成功。近期工作探究了此类无监督预训练用于基于模型的强化学习(MBRL),但局限于特定领域或仿真数据。本文研究利用丰富的真实场景视频预训练世界模型,以高效学习下游视觉控制任务的问题。然而,真实场景视频因各种上下文因素(如复杂背景和纹理外观)而复杂,这阻碍了世界模型提取共享世界知识以实现更好泛化。为应对此问题,我们提出上下文化世界模型(ContextWM),其显式分离上下文与动态建模,以克服真实场景视频的复杂性与多样性,并促进不同场景间的知识迁移。具体而言,通过引入上下文编码器保留上下文信息并增强图像解码器,精心实现了潜变量动态模型的上下文化扩展,从而鼓励潜变量动态模型专注于本质的时间变化。实验表明,配备ContextWM的真实场景视频预训练能显著提升MBRL在机器人操控、运动控制和自动驾驶等多领域的样本效率。代码见仓库:https://github.com/thuml/ContextWM。
引用
@article{arxiv.2305.18499,
title = {Pre-training Contextualized World Models with In-the-wild Videos for Reinforcement Learning},
author = {Jialong Wu and Haoyu Ma and Chaoyi Deng and Mingsheng Long},
journal= {arXiv preprint arXiv:2305.18499},
year = {2023}
}
备注
NeurIPS 2023. Code is available at https://github.com/thuml/ContextWM