中文

面向具有连续状态、动作和观测空间的 POMDP 的在线算法

人工智能 2018-09-07 v6 机器人学 系统与控制

摘要

针对部分可观测马尔可夫决策过程(POMDP)的在线求解器已被应用于具有大型离散状态空间的问题,但连续的状态、动作和观测空间仍是一个挑战。本文首先研究双重渐进宽化(DPW)作为应对该挑战的解决方案。然而,我们证明仅此修改是不够的,因为搜索树中的信念表示会坍缩为单个粒子,导致算法无论计算时间多长都会收敛到次优策略。本文提出并评估了两种新算法 POMCPOW 和 PFT-DPW,它们通过使用加权粒子滤波克服了这一缺陷。仿真结果表明,这些修改使得算法在先前方法失败的场景中能够成功运行。

关键词

引用

@article{arxiv.1709.06196,
  title  = {Online algorithms for POMDPs with continuous state, action, and observation spaces},
  author = {Zachary Sunberg and Mykel Kochenderfer},
  journal= {arXiv preprint arXiv:1709.06196},
  year   = {2018}
}

备注

Added Multilane section