中文

通过对偶上升对连续空间约束 POMDP 进行在线规划

人工智能 2022-12-26 v1

摘要

约束部分可观测马尔可夫决策过程(CPOMDP)通过施加不可违背的硬约束值预算来进行安全规划,而不是用对不良行为的惩罚来扩充奖励。先前针对 CPOMDP 进行在线规划的工作仅应用于离散动作和观测空间。在这项工作中,我们通过对偶上升与渐进扩展相结合,提出了针对连续状态、动作和观测空间的在线 CPOMDP 规划算法。我们在建模了玩具和真实世界安全关键问题的连续 CPOMDP 上经验性地比较了我们提出算法的有效性。此外,我们与将成本约束标量化入奖励的连续无约束 POMDP 在线求解器的使用进行比较,并研究乐观成本传播的影响。

关键词

引用

@article{arxiv.2212.12154,
  title  = {Online Planning for Constrained POMDPs with Continuous Spaces through Dual Ascent},
  author = {Arec Jamgochian and Anthony Corso and Mykel J. Kochenderfer},
  journal= {arXiv preprint arXiv:2212.12154},
  year   = {2022}
}

备注

Submitted to ICAPS-23