C-MCTS:基于蒙特卡洛树搜索的安全规划
机器学习
2024-10-29 v4 人工智能
摘要
约束马尔可夫决策过程(CMDP)表述可用于求解受约束的安全关键决策任务。尽管 CMDP 在强化学习文献中已被广泛研究,但基于采样的规划算法(如 MCTS)用于求解它们的关注甚少。先前方法在代价方面表现保守,因其使用蒙特卡洛代价估计来避免约束违反,而此类估计方差较大。我们提出约束 MCTS(C-MCTS),其利用在安全评判器(safety critic)中通过时序差分学习在智能体部署前的离线阶段训练得到代价估计。该评判器通过在部署期间于 MCTS 内剪枝不安全轨迹来限制探索。C-MCTS 满足代价约束,但运行更贴近约束边界,从而比先前工作获得更高奖励。作为一个良好的副产品,该规划器在规划步数上更高效。最重要的是,在规划器与真实世界存在模型失配时,C-MCTS 比先前工作更不易发生代价违反。
引用
@article{arxiv.2305.16209,
title = {C-MCTS: Safe Planning with Monte Carlo Tree Search},
author = {Dinesh Parthasarathy and Georgios Kontes and Axel Plinge and Christopher Mutschler},
journal= {arXiv preprint arXiv:2305.16209},
year = {2024}
}
备注
Workshop on Safe & Trustworthy Agents @NeurIPS2024