ConstrainedZero:基于学习概率失效代理与自适应安全约束的机率受约束 POMDP 规划
人工智能
2024-05-02 v1
摘要
为在不确定环境中安全规划,智能体必须在效用与安全约束之间进行权衡。安全规划问题可建模为机率受约束部分可观测马尔可夫决策过程 (CC-POMDP),其解决方案常需昂贵的蒙特卡洛树搜索 (MCTS) 或启发式方法来估计最优价值和动作选择策略。本工作引入ConstrainedZero策略迭代算法,通过学习神经网络近似最优价值和策略,同时添加一个网络头估计给定信念下的失效概率。该失效概率指导在在线MCTS期间的安全动作选择。为避免过度依赖失效估计,我们引入Δ-MCTS,该方法使用自适应保守推断来更新规划期间的失效阈值。该方法在安全关键POMDP基准、飞机碰撞避免系统以及安全CO 储存可持续性问题上进行测试。结果表明,通过将安全约束与目标分离,我们可以在不优化奖励与成本平衡的情况下实现目标安全水平。
引用
@article{arxiv.2405.00644,
title = {ConstrainedZero: Chance-Constrained POMDP Planning using Learned Probabilistic Failure Surrogates and Adaptive Safety Constraints},
author = {Robert J. Moss and Arec Jamgochian and Johannes Fischer and Anthony Corso and Mykel J. Kochenderfer},
journal= {arXiv preprint arXiv:2405.00644},
year = {2024}
}
备注
In Proceedings of the 2024 International Joint Conference on Artificial Intelligence (IJCAI)