中文

基于学习模型的连续控制搜索与规划

人工智能 2020-06-23 v2 机器学习

摘要

具有规划能力的决策智能体在象棋、将棋和围棋等挑战性领域取得了巨大成功。为了将规划能力推广到环境动力学对智能体不可用的更一般任务,研究人员提出了MuZero算法,该算法通过与环境的交互来学习动力学模型。在本文中,我们提供了一种方法以及必要的理论结果,将MuZero算法扩展到具有连续动作空间的更一般环境。通过在两个相对低维的MuJoCo环境上的数值结果,我们表明所提出的算法优于软演员-评论家(SAC)算法,这是一种最先进的无模型深度强化学习算法。

关键词

引用

@article{arxiv.2006.07430,
  title  = {Continuous Control for Searching and Planning with a Learned Model},
  author = {Xuxi Yang and Werner Duvaud and Peng Wei},
  journal= {arXiv preprint arXiv:2006.07430},
  year   = {2020}
}