中文

基于简单遗憾的 MCTS

人工智能 2012-07-25 v1 机器学习

摘要

UCT 是用于博弈和马尔可夫决策过程中蒙特卡洛树搜索 (MCTS) 的最先进算法,其基于 UCB,而 UCB 是一种旨在最小化累积遗憾的多臂老虎机问题 (MAB) 采样策略。然而,搜索不同于 MAB,因为在 MCTS 中,通常只有最终的“拉臂”(即实际的走法选择)会获得奖励,而非所有的“拉臂”。因此,最小化简单遗憾比最小化累积遗憾更为合理。我们首先引入了针对多臂老虎机的策略,其在有限时间和渐近意义上的简单遗憾均低于 UCB,并利用该策略开发了一种两阶段方案 (SR+CR) 用于 MCTS,该方案在实证表现上优于 UCT。优化采样过程本身是一个元推理问题,其解决方案可以利用信息价值 (VOI) 技术。尽管搜索的 VOI 理论已经存在,但将其应用于 MCTS 并非易事,因为典型的短视假设会失效。虽然缺乏完整的 MCTS 可用 VOI 理论,我们仍提出了一种“感知”VOI 的采样方案,所得算法在实证评估中表现优于 UCT 及其他提出的算法。

关键词

引用

@article{arxiv.1207.5536,
  title  = {MCTS Based on Simple Regret},
  author = {David Tolpin and Solomon Eyal Shimony},
  journal= {arXiv preprint arXiv:1207.5536},
  year   = {2012}
}

备注

AAAI 2012, 7 pages. arXiv admin note: text overlap with arXiv:1108.3711