A0C:连续动作空间中的 Alpha Zero
机器学习
2018-05-25 v1 人工智能
机器学习
机器人学
系统与控制
摘要
Alpha Zero 的核心新颖之处在于树搜索与深度学习的穿插,其在国际象棋、将棋和围棋等棋盘游戏中已被证明非常成功。这些游戏具有离散动作空间。然而,许多现实世界的强化学习领域具有连续动作空间,例如机器人控制、导航和自动驾驶汽车。本文给出了 Alpha Zero 处理连续动作空间所需的理论扩展。我们还在 Pendulum 摆动任务上提供了一些初步实验,从经验上展示了我们方法的可行性。由此,本工作为迭代搜索与学习在连续动作空间领域中的应用提供了第一步。
关键词
引用
@article{arxiv.1805.09613,
title = {A0C: Alpha Zero in Continuous Action Space},
author = {Thomas M. Moerland and Joost Broekens and Aske Plaat and Catholijn M. Jonker},
journal= {arXiv preprint arXiv:1805.09613},
year = {2018}
}