通过视频预测解耦可控物体以改进视觉强化学习
机器学习
2020-02-24 v1 计算机视觉与模式识别
机器学习
摘要
在许多基于视觉的强化学习(RL)问题中,智能体在其视觉场中控制一个可移动物体,例如视频游戏中的玩家角色以及视觉抓取与操作中的机械臂。利用动作条件视频预测,我们提出一种端到端学习框架,从观测信号中解耦出可控物体。解耦后的表示被证明可作为智能体的附加观测通道而有益于 RL。在一系列 Atari 游戏上使用流行的 Double DQN 算法的实验表明,其样本效率与游戏性能得到提升(以归一化游戏分数衡量从 222.8% 提升至 261.4%,含预测奖励加成)。
引用
@article{arxiv.2002.09136,
title = {Disentangling Controllable Object through Video Prediction Improves Visual Reinforcement Learning},
author = {Yuanyi Zhong and Alexander Schwing and Jian Peng},
journal= {arXiv preprint arXiv:2002.09136},
year = {2020}
}
备注
Accepted to ICASSP 2020