面向具有连续状态、动作和观测空间的 POMDP 的在线算法
人工智能
2018-09-07 v6 机器人学
系统与控制
摘要
针对部分可观测马尔可夫决策过程(POMDP)的在线求解器已被应用于具有大型离散状态空间的问题,但连续的状态、动作和观测空间仍是一个挑战。本文首先研究双重渐进宽化(DPW)作为应对该挑战的解决方案。然而,我们证明仅此修改是不够的,因为搜索树中的信念表示会坍缩为单个粒子,导致算法无论计算时间多长都会收敛到次优策略。本文提出并评估了两种新算法 POMCPOW 和 PFT-DPW,它们通过使用加权粒子滤波克服了这一缺陷。仿真结果表明,这些修改使得算法在先前方法失败的场景中能够成功运行。
引用
@article{arxiv.1709.06196,
title = {Online algorithms for POMDPs with continuous state, action, and observation spaces},
author = {Zachary Sunberg and Mykel Kochenderfer},
journal= {arXiv preprint arXiv:1709.06196},
year = {2018}
}
备注
Added Multilane section