大型 POMDP 的任意时间点近似方法
人工智能
2011-10-05 v2
摘要
部分可观测马尔可夫决策过程(POMDP)长期以来被视为现实世界规划与控制问题(尤其在机器人学中)的一个丰富框架。然而,该框架下的精确求解通常在计算上难以处理,仅对最小规模的问题可行。一种用于加速 POMDP 求解的众所周知的技术是在特定信念点而非整个信念单纯形上执行值回溯。然而,该方法的效率在很大程度上取决于点的选择。本文提出一组在实践中表现良好的、用于选择信息性信念点的新技术。将点选择过程与基于点的值回溯相结合,形成了一种有效的任意时间 POMDP 算法,称为基于点的值迭代(PBVI)。本文的首要目标是介绍该算法,并给出理论分析以证明信念点选择技术的合理性。本文的第二个目标是提供 PBVI 与其他最先进的 POMDP 方法(特别是 Perseus 算法)之间全面的经验比较,以突出它们的异同。评估在标准 POMDP 领域和真实机器人任务上进行。
引用
@article{arxiv.1110.0027,
title = {Anytime Point-Based Approximations for Large POMDPs},
author = {J. Pineau and G. Gordon and S. Thrun},
journal= {arXiv preprint arXiv:1110.0027},
year = {2011}
}