面向持续运行任务且具有可扩展模拟周期的蒙特卡洛树搜索
人工智能
2018-09-10 v1
摘要
蒙特卡洛树搜索(MCTS)特别适用于可将潜在动作表示为顺序决策树的领域。为了有效地选择动作,MCTS 执行大量模拟以构建决策空间的可靠树表示。因此,当在动作选择之间无法执行足够多的模拟时,MCTS 的瓶颈便显现出来。这在持续运行任务中尤为突出,由于环境状态不断变化,动作之间可用于执行模拟的时间往往有限。在本文中,我们提出一种方法,利用 MCTS 的随时(anytime)特性,在允许的情况下增加模拟时间。我们的方法是有效地平衡选择某个动作的前景与在下一次动作选择之前可腾出用于执行 MCTS 模拟的时间。为此,我们将模拟时间视为与动作一同被选中的决策变量。我们扩展了应用于树的分层乐观优化(HOOT)方法,以使我们的方法适应具有连续决策空间的环境。我们通过 OpenAI gym 的 Pendulum 和 Continuous Mountain Car 环境评估了我们在连续决策空间环境中的方法,并通过街机学习环境(ALE)平台评估了离散动作空间环境。评估结果表明,在可变模拟时间下,所提方法在评估的连续决策空间任务中优于常规 MCTS,并在大多数 ALE 任务中提升了 MCTS 的性能。
引用
@article{arxiv.1809.02378,
title = {Monte Carlo Tree Search with Scalable Simulation Periods for Continuously Running Tasks},
author = {Seydou Ba and Takuya Hiraoka and Takashi Onishi and Toru Nakata and Yoshimasa Tsuruoka},
journal= {arXiv preprint arXiv:1809.02378},
year = {2018}
}