B$^3$RTDP:一种用于求解 POMDP 的信念分支定界实时动态规划方法
人工智能
2022-10-25 v1
摘要
部分可观测马尔可夫决策过程(POMDPs)为自主智能体提供了一种有前景的世界表示,因为它们可以建模转移和感知两方面的不确定性。计算 POMDP 问题的最优解可能计算代价高昂,因为它们需要在(可能是无限的)信念空间上进行推理。已有若干方法被提出以克服这一困难,例如离散化信念空间、基于点的信念采样和蒙特卡洛树搜索。RTDP-Bel 算法的实时动态规划方法通过将值函数存储在具有离散化信念键的哈希表中来近似值函数。我们提出了 RTDP-Bel 算法的一个扩展,称之为信念分支定界 RTDP(BRTDP)。我们的算法使用有界值函数表示,并以两种新颖方式加以利用:一种基于动作选择收敛概率的搜索定界技术,以及一种利用早期动作收敛的称为 \textit{收敛边界}(Convergence Frontier)的方法。最后,我们通过实验证明,在已知的 POMDP 问题上,BRTDP 能够比最先进的 SARSOP 求解器在更短时间内获得更高回报。
引用
@article{arxiv.2210.12556,
title = {B$^3$RTDP: A Belief Branch and Bound Real-Time Dynamic Programming Approach to Solving POMDPs},
author = {Sigurdur Orn Adalgeirsson and Cynthia Breazeal},
journal= {arXiv preprint arXiv:2210.12556},
year = {2022}
}
备注
Originally authored in 2014-2015