面向多约束安全关键应用的具有目标抑制功能的均匀安全强化学习
机器学习
2024-08-30 v3 人工智能
摘要
安全强化学习任务是一个充满挑战的领域,尽管其在现实世界中非常普遍。广泛采用的 CMDP 模型约束了期望风险,这使得长尾状态下的危险行为成为可能。在安全关键领域,此类行为可能导致灾难性后果。为解决这一问题,我们首先用更强的均匀约束 MDP (UCMDP) 模型描述该问题,在该模型中我们对所有可达状态施加约束;随后我们提出目标抑制(Objective Suppression),这是一种新颖的方法,它根据安全评论家自适应地抑制最大化任务奖励的目标,作为 UCMDP 拉格朗日对偶问题的解。我们在两个多约束安全领域对目标抑制进行了基准测试,包括一个任何错误行为都可能导致灾难性后果的自动驾驶领域。在驾驶领域,我们利用开源和专有数据进行了评估,并评估了向真实自动驾驶车队的迁移能力。实证表明,我们提出的方法与现有安全强化学习算法结合时,能在显著减少约束违规的同时,达到与基线相当的任务奖励。
引用
@article{arxiv.2402.15650,
title = {Uniformly Safe RL with Objective Suppression for Multi-Constraint Safety-Critical Applications},
author = {Zihan Zhou and Jonathan Booher and Khashayar Rohanimanesh and Wei Liu and Aleksandr Petiushko and Animesh Garg},
journal= {arXiv preprint arXiv:2402.15650},
year = {2024}
}