MDP 中的动作选择:Anytime AO* 与 UCT 的比较
人工智能
2019-09-27 v1
摘要
在存在非可采纳启发式的情况下,A* 及其他最佳优先算法可通过在找到首个解后继续搜索,转化为 OR 图上的 anytime 最优算法。然而,同样的技巧对 AND/OR 图上的最佳优先算法并不奏效,后者必须能够扩展显式图的叶节点,而这些节点未必属于最佳部分解。因此,AO* 的 anytime 最优变体必须应对探索-利用权衡:它们不能仅“利用”,还必须持续探索。本工作中,我们开发了 AO* 的一个此类变体,并将其应用于有限时域 MDP。该 Anytime AO* 算法在使用可采样的非可采纳随机启发式(如启发式为可通过 rollout 采样的基策略代价时)的情况下,最终能给出最优策略。随后,我们将 Anytime AO* 用于大型无限时域 MDP 的动作选择,这些 MDP 无法用现有离线启发式搜索与动态规划算法求解,并将其与 UCT 进行比较。
引用
@article{arxiv.1909.12104,
title = {Action Selection for MDPs: Anytime AO* vs. UCT},
author = {Blai Bonet and Hector Geffner},
journal= {arXiv preprint arXiv:1909.12104},
year = {2019}
}
备注
Proceedings AAAI-12