中文

物理嵌入的规划问题:强化学习的新挑战

人工智能 2020-10-30 v2 机器学习

摘要

深度强化学习 (RL) 近期的成果已产生能够掌握围棋、国际象棋或将棋等挑战性游戏的算法。在这些工作中,RL 智能体直接观察游戏的自然状态,并通过其动作直接控制该状态。然而,当人类玩此类游戏时,他们不仅推理走法,还与物理环境交互。他们通过观看面前的物理棋盘来理解游戏状态,并通过触摸和精细运动控制操纵棋子来改变它。掌握具有抽象目标的复杂物理系统是人工智能的核心挑战,但对现有 RL 算法而言仍无法实现。为鼓励朝此目标取得进展,我们引入一组物理嵌入的规划问题并公开提供。我们将具有挑战性的符号任务(推箱子、井字棋和围棋)嵌入物理引擎中,以产生一组需要跨长时间尺度的感知、推理和运动控制的任务。尽管现有 RL 算法可以处理这些任务的符号版本,我们发现它们甚至难以掌握其最简单的物理嵌入对应任务。作为刻画这些任务解空间的第一步,我们引入一个强基线,该基线在抽象空间中使用预训练专家游戏玩家为 RL 智能体策略提供提示,同时在其完整的感觉运动控制任务上训练它。所得智能体解决了许多任务,凸显了弥合抽象规划与具身控制之间差距的方法之需求。说明视频见 https://youtu.be/RwHiHlym_1k。

关键词

引用

@article{arxiv.2009.05524,
  title  = {Physically Embedded Planning Problems: New Challenges for Reinforcement Learning},
  author = {Mehdi Mirza and Andrew Jaegle and Jonathan J. Hunt and Arthur Guez and Saran Tunyasuvunakool and Alistair Muldal and Théophane Weber and Peter Karkus and Sébastien Racanière and Lars Buesing and Timothy Lillicrap and Nicolas Heess},
  journal= {arXiv preprint arXiv:2009.05524},
  year   = {2020}
}

备注

17 pages + appendix. Updated text and references