中文

通过观看YouTube视频通关高难度探索游戏

机器学习 2018-12-03 v2 人工智能 计算机视觉与模式识别 机器学习

摘要

深度强化学习方法在传统上难以应对环境奖励特别稀疏的任务。在这些领域中引导探索的一种成功方法是模仿人类演示者提供的轨迹。然而,这些演示通常是在人工条件下收集的,即能够访问智能体的精确环境设置以及演示者的动作和奖励轨迹。在此我们提出一种两阶段方法,该方法通过依赖有噪声、未对齐的 footage 且无需访问此类数据来克服这些限制。首先,我们利用在时间和模态(即视觉与声音)上构建的自监督目标,学习将来自多个来源的未对齐视频映射到一种共同表示。其次,我们将单个YouTube视频嵌入该表示中以构建奖励函数,鼓励智能体模仿人类游戏玩法。这种一次性模仿方法使我们的智能体首次在声名狼藉的高难度探索游戏 Montezuma's Revenge、Pitfall! 和 Private Eye 上令人信服地超越人类水平表现,即使未向智能体提供任何环境奖励。

关键词

引用

@article{arxiv.1805.11592,
  title  = {Playing hard exploration games by watching YouTube},
  author = {Yusuf Aytar and Tobias Pfaff and David Budden and Tom Le Paine and Ziyu Wang and Nando de Freitas},
  journal= {arXiv preprint arXiv:1805.11592},
  year   = {2018}
}