瞬时硬约束下安全强化学习的近最优算法
机器学习
2023-02-10 v1 人工智能
摘要
在强化学习(RL)的许多应用中,算法安全地执行至关重要,即每一步都满足瞬时硬约束,并避免不安全的状态与动作。然而,现有的“安全”RL算法通常设计在以下约束下:要么要求期望累积代价有界,要么假设所有状态安全。因此,此类算法在实践中可能违反瞬时硬约束并遍历不安全状态(和动作)。因此,在本文中,我们针对具有不安全状态和动作、处于瞬时硬约束及线性混合模型的回合式马尔可夫决策过程,开发了首个近最优安全RL算法。它不仅实现了后悔,该值与仅有不安全动作设定下的最先进后悔紧密匹配,并几乎匹配无约束设定下的后悔,而且在每一步都是安全的,其中为特征映射维度,为轮次数,为每轮步数,为安全相关参数。我们还提供了下界,表明对的依赖是必要的。此外,我们的算法设计和后悔分析都涉及若干新颖思想,这可能具有独立意义。
引用
@article{arxiv.2302.04375,
title = {A Near-Optimal Algorithm for Safe Reinforcement Learning Under Instantaneous Hard Constraints},
author = {Ming Shi and Yingbin Liang and Ness Shroff},
journal= {arXiv preprint arXiv:2302.04375},
year = {2023}
}
备注
Submitted for publication