中文

MDP 中的动作选择:Anytime AO* 与 UCT 的比较

人工智能 2019-09-27 v1

摘要

在存在非可采纳启发式的情况下,A* 及其他最佳优先算法可通过在找到首个解后继续搜索,转化为 OR 图上的 anytime 最优算法。然而,同样的技巧对 AND/OR 图上的最佳优先算法并不奏效,后者必须能够扩展显式图的叶节点,而这些节点未必属于最佳部分解。因此,AO* 的 anytime 最优变体必须应对探索-利用权衡:它们不能仅“利用”,还必须持续探索。本工作中,我们开发了 AO* 的一个此类变体,并将其应用于有限时域 MDP。该 Anytime AO* 算法在使用可采样的非可采纳随机启发式(如启发式为可通过 rollout 采样的基策略代价时)的情况下,最终能给出最优策略。随后,我们将 Anytime AO* 用于大型无限时域 MDP 的动作选择,这些 MDP 无法用现有离线启发式搜索与动态规划算法求解,并将其与 UCT 进行比较。

关键词

引用

@article{arxiv.1909.12104,
  title  = {Action Selection for MDPs: Anytime AO* vs. UCT},
  author = {Blai Bonet and Hector Geffner},
  journal= {arXiv preprint arXiv:1909.12104},
  year   = {2019}
}

备注

Proceedings AAAI-12