基于视频的无动作预训练强化学习
计算机视觉与模式识别
2022-06-20 v2 人工智能
摘要
近期的无监督预训练方法已通过在语言和视觉领域学习对多个下游任务有用的表示而展现出有效性。本文中,我们探究此类无监督预训练方法是否也能对基于视觉的强化学习(RL)有效。为此,我们引入一个通过对视频进行生成式预训练来学习有助于理解动力学的表示的框架。我们的框架包含两阶段:预训练一个无动作潜变量视频预测模型,然后利用预训练表示在未见过环境中高效学习动作条件世界模型。为在微调时纳入额外动作输入,我们提出一种新架构,在预训练的无动作预测模型之上堆叠一个动作条件潜变量预测模型。此外,为更好探索,我们提出一种利用预训练表示的基于视频的内在奖励。我们证明我们的框架在多种操作与运动任务中显著提升了基于视觉RL的最终性能与样本效率。代码见 https://github.com/younggyoseo/apv。
引用
@article{arxiv.2203.13880,
title = {Reinforcement Learning with Action-Free Pre-Training from Videos},
author = {Younggyo Seo and Kimin Lee and Stephen James and Pieter Abbeel},
journal= {arXiv preprint arXiv:2203.13880},
year = {2022}
}
备注
International Conference on Machine Learning (ICML 2022). Project page: https://sites.google.com/view/rl-apv