中文

基于蒙特卡洛树搜索的 POMDP 学习

人工智能 2018-06-15 v1 机器学习

摘要

POMDP 是在结果不确定与信息不确定下推理的有力框架,但构建准确的 POMDP 模型十分困难。贝叶斯自适应部分可观测马尔可夫决策过程(BA-POMDPs)扩展了 POMDP,允许在执行过程中学习模型。BA-POMDPs 是一种贝叶斯强化学习(RL)方法,原则上允许在利用与探索间进行最优权衡。遗憾的是,BA-POMDPs 目前对任何非平凡领域均难以求解。本文中,我们将蒙特卡洛树搜索方法 POMCP 扩展至 BA-POMDPs,并表明所得方法(称为 BA-POMCP)能够处理先前求解方法无法解决的问题。此外,我们引入若干利用 BA-POMDP 结构提升 BA-POMCP 效率的技术,并给出其收敛性证明。

关键词

引用

@article{arxiv.1806.05631,
  title  = {Learning in POMDPs with Monte Carlo Tree Search},
  author = {Sammie Katt and Frans A. Oliehoek and Christopher Amato},
  journal= {arXiv preprint arXiv:1806.05631},
  year   = {2018}
}