中文

ConstrainedZero:基于学习概率失效代理与自适应安全约束的机率受约束 POMDP 规划

人工智能 2024-05-02 v1

摘要

为在不确定环境中安全规划,智能体必须在效用与安全约束之间进行权衡。安全规划问题可建模为机率受约束部分可观测马尔可夫决策过程 (CC-POMDP),其解决方案常需昂贵的蒙特卡洛树搜索 (MCTS) 或启发式方法来估计最优价值和动作选择策略。本工作引入ConstrainedZero策略迭代算法,通过学习神经网络近似最优价值和策略,同时添加一个网络头估计给定信念下的失效概率。该失效概率指导在在线MCTS期间的安全动作选择。为避免过度依赖失效估计,我们引入Δ-MCTS,该方法使用自适应保守推断来更新规划期间的失效阈值。该方法在安全关键POMDP基准、飞机碰撞避免系统以及安全CO2_2 储存可持续性问题上进行测试。结果表明,通过将安全约束与目标分离,我们可以在不优化奖励与成本平衡的情况下实现目标安全水平。

关键词

引用

@article{arxiv.2405.00644,
  title  = {ConstrainedZero: Chance-Constrained POMDP Planning using Learned Probabilistic Failure Surrogates and Adaptive Safety Constraints},
  author = {Robert J. Moss and Arec Jamgochian and Johannes Fischer and Anthony Corso and Mykel J. Kochenderfer},
  journal= {arXiv preprint arXiv:2405.00644},
  year   = {2024}
}

备注

In Proceedings of the 2024 International Joint Conference on Artificial Intelligence (IJCAI)