约束分层蒙特卡洛信念状态规划
人工智能
2024-02-27 v2 机器人学
摘要
约束部分可观测马尔可夫决策过程(CPOMDP)中的最优计划在满足硬性代价约束的同时最大化奖励目标,推广了状态与转移不确定性下的安全规划。遗憾的是,在线 CPOMDP 规划在大型或连续问题域中极为困难。在许多大型机器人域中,分层分解可通过为高层动作基元(选项)提供底层控制工具来简化规划。我们引入约束选项信念树搜索(COBeTS)以利用该层次结构,将基于在线搜索的 CPOMDP 规划扩展到大型机器人问题。我们证明,若基元选项控制器被定义为满足分配的约束预算,则 COBeTS 将随时满足约束。否则,COBeTS 将引导搜索走向安全的选项基元序列,且可使用分层监视实现运行期安全。我们在多个安全关键的约束部分可观测机器人域中展示了 COBeTS,表明它能在连续 CPOMDP 中成功规划,而非分层基线无法做到。
引用
@article{arxiv.2310.20054,
title = {Constrained Hierarchical Monte Carlo Belief-State Planning},
author = {Arec Jamgochian and Hugo Buurmeijer and Kyle H. Wray and Anthony Corso and Mykel J. Kochenderfer},
journal= {arXiv preprint arXiv:2310.20054},
year = {2024}
}
备注
Accepted to the 2024 IEEE International Conference on Robotics and Automation (ICRA)