中文

约束分层蒙特卡洛信念状态规划

人工智能 2024-02-27 v2 机器人学

摘要

约束部分可观测马尔可夫决策过程(CPOMDP)中的最优计划在满足硬性代价约束的同时最大化奖励目标,推广了状态与转移不确定性下的安全规划。遗憾的是,在线 CPOMDP 规划在大型或连续问题域中极为困难。在许多大型机器人域中,分层分解可通过为高层动作基元(选项)提供底层控制工具来简化规划。我们引入约束选项信念树搜索(COBeTS)以利用该层次结构,将基于在线搜索的 CPOMDP 规划扩展到大型机器人问题。我们证明,若基元选项控制器被定义为满足分配的约束预算,则 COBeTS 将随时满足约束。否则,COBeTS 将引导搜索走向安全的选项基元序列,且可使用分层监视实现运行期安全。我们在多个安全关键的约束部分可观测机器人域中展示了 COBeTS,表明它能在连续 CPOMDP 中成功规划,而非分层基线无法做到。

关键词

引用

@article{arxiv.2310.20054,
  title  = {Constrained Hierarchical Monte Carlo Belief-State Planning},
  author = {Arec Jamgochian and Hugo Buurmeijer and Kyle H. Wray and Anthony Corso and Mykel J. Kochenderfer},
  journal= {arXiv preprint arXiv:2310.20054},
  year   = {2024}
}

备注

Accepted to the 2024 IEEE International Conference on Robotics and Automation (ICRA)