中文

具有逐步违规约束的可证明安全强化学习

机器学习 2023-06-12 v3

摘要

本文研究一类具有逐步违规约束的新型安全强化学习问题。我们的问题与现有工作的不同之处在于考虑了更严格的逐步违规约束,且不假设安全动作的存在,这使得我们的形式化更适用于需要在所有决策步骤确保安全性且可能并非总具备安全动作的安全关键应用,例如机器人控制和自动驾驶。我们提出一种新颖算法 SUCBVI,其保证 O~(ST)\widetilde{O}(\sqrt{ST}) 的逐步违规和 O~(H3SAT)\widetilde{O}(\sqrt{H^3SAT}) 的遗憾值。给出了下界以验证在违规和遗憾性能上相对于 SSTT 的最优性。此外,我们进一步研究了一类具有逐步违规约束的新型安全无奖励探索问题。对于该问题,我们设计了 (ε,δ)(\varepsilon,\delta)-PAC 算法 SRF-UCRL,其达到近乎最优的样本复杂度 O~((S2AH2ε+H4SAε2)(log(1δ)+S))\widetilde{O}((\frac{S^2AH^2}{\varepsilon}+\frac{H^4SA}{\varepsilon^2})(\log(\frac{1}{\delta})+S)),并在探索过程中保证 O~(ST)\widetilde{O}(\sqrt{ST}) 的违规。实验结果证明了我们的算法在安全性能上的优越性,并佐证了我们的理论结果。

关键词

引用

@article{arxiv.2302.06064,
  title  = {Provably Safe Reinforcement Learning with Step-wise Violation Constraints},
  author = {Nuoya Xiong and Yihan Du and Longbo Huang},
  journal= {arXiv preprint arXiv:2302.06064},
  year   = {2023}
}