SCPO:基于安全评论家策略优化的安全强化学习
机器学习
2023-11-03 v1 人工智能
摘要
将安全性纳入是拓展强化学习在真实场景中实际应用的基本前提。为应对这一挑战,研究者利用约束马尔可夫决策过程(CMDPs),其引入了表示安全违规的独立的代价函数。在 CMDPs 设定下,先前的算法采用拉格朗日松弛技术将约束优化问题转化为无约束对偶问题。然而,这些算法可能不准确预测不安全行为,导致学习拉格朗日乘子时的不稳定性。本研究提出一种新颖的安全强化学习算法——安全评论家策略优化(SCPO)。在本研究中,我们定义了安全评论家,一种将使违反安全约束所获得的奖励归零的机制。此外,我们的理论分析表明,所提算法能自动平衡遵守安全约束与最大化奖励之间的权衡。SCPO 算法的有效性通过与强基线进行基准测试得到了实证验证。
引用
@article{arxiv.2311.00880,
title = {SCPO: Safe Reinforcement Learning with Safety Critic Policy Optimization},
author = {Jaafar Mhamed and Shangding Gu},
journal= {arXiv preprint arXiv:2311.00880},
year = {2023}
}