中文

风险感知的自适应信念依赖概率约束连续 POMDP 规划

人工智能 2023-02-22 v2 机器人学

摘要

尽管风险感知对于在线运行的智能体至关重要,但在具有挑战性的连续域以及部分可观测条件下,它受到的关注较少。本文提出了一种针对风险厌恶、信念依赖且概率约束的连续 POMDP 的新颖形式化与求解方法。我们处理了一种具有信念依赖奖励与约束算子的严苛设定。概率置信参数使我们的形式化真正具有风险厌恶特性,并且比最先进的机遇约束(chance constraint)灵活得多。我们的严格分析表明,在最严格的概率置信情形下,我们的形式化非常接近机遇约束。然而,我们的概率形式化允许对满足或违反约束的动作进行快得多且更精确的自适应接受或剪枝。此外,在任意置信参数下,我们未发现有与我们的方法类似的方案。我们给出了在连续域中求解我们形式化的算法。我们还利用重要性采样将机遇约束方法提升到连续环境中。而且,我们提出的所有算法均可与由粒子表示的参数化及非参数化信念一同使用。最后但同样重要的是,我们提出、严格分析并仿真了一种机遇约束连续 POMDP 的近似方法。仿真表明,与基线相比,我们的算法展现出前所未有的迅捷性,且在碰撞方面具有相同的性能。

关键词

引用

@article{arxiv.2209.02679,
  title  = {Risk Aware Adaptive Belief-dependent Probabilistically Constrained Continuous POMDP Planning},
  author = {Andrey Zhitnikov and Vadim Indelman},
  journal= {arXiv preprint arXiv:2209.02679},
  year   = {2023}
}

备注

The paper was substantially improved and fixed