感知信息价值的 MCTS
人工智能
2012-07-25 v1 机器学习
摘要
UCT 是用于博弈和马尔可夫决策过程中蒙特卡洛树搜索 (MCTS) 的最先进算法,其基于 UCB1,这是一种针对多臂老虎机问题 (MAB) 的采样策略,旨在最小化累积遗憾。然而,搜索与 MAB 不同,因为在 MCTS 中,通常只有最终的“拉臂”(即实际的走法选择)会获得奖励,而非所有的“拉臂”。在本文中,提出了一种基于 rollout 的信息价值 (VOI) 估计的 MCTS 采样策略。我们在随机 MAB 实例以及计算机围棋上对该策略进行了实证评估,并与 UCB1 和 UCT 进行了比较。
引用
@article{arxiv.1207.5589,
title = {VOI-aware MCTS},
author = {David Tolpin and Solomon Eyal Shimony},
journal= {arXiv preprint arXiv:1207.5589},
year = {2012}
}
备注
2 pages, ECAI 2012