Rao-Blackwell 化的 POMDP 规划
人工智能
2025-03-05 v2 机器学习
机器人学
摘要
部分可观测 Markov 决策过程(POMDP)为不确定性下的决策提供了结构化框架,但其应用需要高效的信念更新。序贯重要性重采样粒子滤波(SIRPF),也称为 Bootstrap 粒子滤波,通常在大型近似 POMDP 求解器中用作信念更新器,但随着系统状态维度的增长,它们面临粒子贫化和高计算成本等挑战。为了解决这些问题,本研究引入了 Rao-Blackwell 化的 POMDP(RB-POMDP)近似求解器,并概述了在信念更新和在线规划中应用 Rao-Blackwell 化的通用方法。我们在一个模拟定位问题中比较了 SIRPF 和 Rao-Blackwell 化粒子滤波(RBPF)的性能,在该问题中,智能体在 GPS 拒止环境中使用 POMCPOW 和 RB-POMCPOW 规划器导航至目标。我们的结果不仅证实了 RBPF 随着时间的推移能用更少的粒子保持准确的信念近似,而且更令人惊讶的是,在相同的计算限制下,与基于 SIRPF 的规划相比,结合基于求积积分的 RBPF 显著提高了规划质量。
引用
@article{arxiv.2409.16392,
title = {Rao-Blackwellized POMDP Planning},
author = {Jiho Lee and Nisar R. Ahmed and Kyle H. Wray and Zachary N. Sunberg},
journal= {arXiv preprint arXiv:2409.16392},
year = {2025}
}