基于学习模型的连续控制搜索与规划
人工智能
2020-06-23 v2 机器学习
摘要
具有规划能力的决策智能体在象棋、将棋和围棋等挑战性领域取得了巨大成功。为了将规划能力推广到环境动力学对智能体不可用的更一般任务,研究人员提出了MuZero算法,该算法通过与环境的交互来学习动力学模型。在本文中,我们提供了一种方法以及必要的理论结果,将MuZero算法扩展到具有连续动作空间的更一般环境。通过在两个相对低维的MuJoCo环境上的数值结果,我们表明所提出的算法优于软演员-评论家(SAC)算法,这是一种最先进的无模型深度强化学习算法。
引用
@article{arxiv.2006.07430,
title = {Continuous Control for Searching and Planning with a Learned Model},
author = {Xuxi Yang and Werner Duvaud and Peng Wei},
journal= {arXiv preprint arXiv:2006.07430},
year = {2020}
}