中文

瞬时硬约束下安全强化学习的近最优算法

机器学习 2023-02-10 v1 人工智能

摘要

在强化学习(RL)的许多应用中,算法安全地执行至关重要,即每一步都满足瞬时硬约束,并避免不安全的状态与动作。然而,现有的“安全”RL算法通常设计在以下约束下:要么要求期望累积代价有界,要么假设所有状态安全。因此,此类算法在实践中可能违反瞬时硬约束并遍历不安全状态(和动作)。因此,在本文中,我们针对具有不安全状态和动作、处于瞬时硬约束及线性混合模型的回合式马尔可夫决策过程,开发了首个近最优安全RL算法。它不仅实现了后悔O~(dH3dKΔc)\tilde{O}(\frac{d H^3 \sqrt{dK}}{\Delta_c}),该值与仅有不安全动作设定下的最先进后悔紧密匹配,并几乎匹配无约束设定下的后悔,而且在每一步都是安全的,其中dd为特征映射维度,KK为轮次数,HH为每轮步数,Δc\Delta_c为安全相关参数。我们还提供了下界Ω~(max{dHK,HΔc2})\tilde{\Omega}(\max\{dH \sqrt{K}, \frac{H}{\Delta_c^2}\}),表明对Δc\Delta_c的依赖是必要的。此外,我们的算法设计和后悔分析都涉及若干新颖思想,这可能具有独立意义。

关键词

引用

@article{arxiv.2302.04375,
  title  = {A Near-Optimal Algorithm for Safe Reinforcement Learning Under Instantaneous Hard Constraints},
  author = {Ming Shi and Yingbin Liang and Ness Shroff},
  journal= {arXiv preprint arXiv:2302.04375},
  year   = {2023}
}

备注

Submitted for publication