中文

蒙特卡洛信息导向规划

人工智能 2021-03-23 v1

摘要

在本文中,我们讨论如何求解表示为 rho-POMDPs 的信息收集问题,rho-POMDPs 是部分可观测马尔可夫决策过程(POMDPs)的扩展,其奖励 rho 依赖于信念状态。用于求解 POMDPs 的基于点的方法已被扩展为在奖励 rho 关于 B 凸或 Lipschitz 连续时作为信念 MDP 求解 rho-POMDPs。在本文中,我们基于 POMCP 算法提出一种面向 rho-POMDPs 的蒙特卡洛树搜索,旨在构建一个可用于任意 rho 函数的高效在线规划器。由于信念依赖奖励,需进行如下适配:(i) 一次传播多于一个状态,(ii) 防止价值估计中的偏差。当 rho 连续时,给出了收敛至 epsilon-最优价值的渐近收敛证明。实验用于分析所述算法,并表明其优于短视方法。

关键词

引用

@article{arxiv.2103.11345,
  title  = {Monte Carlo Information-Oriented Planning},
  author = {Vincent Thomas and Gérémy Hutin and Olivier Buffet},
  journal= {arXiv preprint arXiv:2103.11345},
  year   = {2021}
}

备注

9 pages, revised version of ECAI 2020 paper