中文

通过视频预测解耦可控物体以改进视觉强化学习

机器学习 2020-02-24 v1 计算机视觉与模式识别 机器学习

摘要

在许多基于视觉的强化学习(RL)问题中,智能体在其视觉场中控制一个可移动物体,例如视频游戏中的玩家角色以及视觉抓取与操作中的机械臂。利用动作条件视频预测,我们提出一种端到端学习框架,从观测信号中解耦出可控物体。解耦后的表示被证明可作为智能体的附加观测通道而有益于 RL。在一系列 Atari 游戏上使用流行的 Double DQN 算法的实验表明,其样本效率与游戏性能得到提升(以归一化游戏分数衡量从 222.8% 提升至 261.4%,含预测奖励加成)。

关键词

引用

@article{arxiv.2002.09136,
  title  = {Disentangling Controllable Object through Video Prediction Improves Visual Reinforcement Learning},
  author = {Yuanyi Zhong and Alexander Schwing and Jian Peng},
  journal= {arXiv preprint arXiv:2002.09136},
  year   = {2020}
}

备注

Accepted to ICASSP 2020