蒙特卡洛信息导向规划
人工智能
2021-03-23 v1
摘要
在本文中,我们讨论如何求解表示为 rho-POMDPs 的信息收集问题,rho-POMDPs 是部分可观测马尔可夫决策过程(POMDPs)的扩展,其奖励 rho 依赖于信念状态。用于求解 POMDPs 的基于点的方法已被扩展为在奖励 rho 关于 B 凸或 Lipschitz 连续时作为信念 MDP 求解 rho-POMDPs。在本文中,我们基于 POMCP 算法提出一种面向 rho-POMDPs 的蒙特卡洛树搜索,旨在构建一个可用于任意 rho 函数的高效在线规划器。由于信念依赖奖励,需进行如下适配:(i) 一次传播多于一个状态,(ii) 防止价值估计中的偏差。当 rho 连续时,给出了收敛至 epsilon-最优价值的渐近收敛证明。实验用于分析所述算法,并表明其优于短视方法。
引用
@article{arxiv.2103.11345,
title = {Monte Carlo Information-Oriented Planning},
author = {Vincent Thomas and Gérémy Hutin and Olivier Buffet},
journal= {arXiv preprint arXiv:2103.11345},
year = {2021}
}
备注
9 pages, revised version of ECAI 2020 paper