中文

学习即规划:通过蒙特卡洛树搜索实现接近贝叶斯最优的强化学习

人工智能 2012-02-20 v1

摘要

贝叶斯最优行为虽然定义明确,但通常难以实现。最近在蒙特卡洛树搜索(MCTS)方面的进展表明,可以在具有非常大或无限状态空间的马尔可夫决策过程(MDP)中实现接近最优的行为。在未知MDP中的贝叶斯最优行为等价于已知信念状态MDP中的最优行为,尽管该信念状态MDP的大小随保留的历史量呈指数增长,并且可能是无限的。我们展示了智能体如何以一种高效的方式使用一种特定的MCTS算法——前向搜索稀疏采样(FSSS),在除了多项式步数之外的所有步骤中实现接近贝叶斯最优的行为,假设FSSS可以在任何可能的底层MDP中高效地行动。

关键词

引用

@article{arxiv.1202.3699,
  title  = {Learning is planning: near Bayes-optimal reinforcement learning via Monte-Carlo tree search},
  author = {John Asmuth and Michael L. Littman},
  journal= {arXiv preprint arXiv:1202.3699},
  year   = {2012}
}