由符号建议引导的 MDP 蒙特卡洛树搜索
计算机科学与博弈论
2020-07-17 v2
摘要
在本文中,我们考虑在线计算一种策略,旨在优化马尔可夫决策过程中的期望平均奖励。该策略以滚动时域方式计算,并使用蒙特卡洛树搜索(MCTS)。我们用符号建议的概念增强了 MCTS 算法,并证明其经典理论保证得以保持。符号建议用于偏置 MCTS 的选择和模拟策略。我们描述了如何使用 QBF 和 SAT 求解器以高效方式实现符号建议。我们使用流行的游戏 Pac-Man 来说明我们的新算法,并表明我们算法的性能超过了普通 MCTS 以及人类玩家的性能。
引用
@article{arxiv.2006.04712,
title = {Monte Carlo Tree Search guided by Symbolic Advice for MDPs},
author = {Damien Busatto-Gaston and Debraj Chakraborty and Jean-Francois Raskin},
journal= {arXiv preprint arXiv:2006.04712},
year = {2020}
}