中文

基于线性函数逼近的安全强化学习

机器学习 2021-06-14 v1 机器学习

摘要

近年来,强化学习中的安全性变得愈发重要。然而,现有方案要么无法严格避免选择不安全动作(可能在安全关键系统中导致灾难性后果),要么无法为需要学习安全约束的设置提供后悔界保证。在本文中,我们首先将安全性建模为状态与动作的未知线性代价函数,该函数必须始终低于某一阈值,从而解决上述两个问题。随后,我们针对具有线性函数逼近的片段式马尔可夫决策过程(MDP)提出称为 SLUCB-QVI 和 RSLUCB-QVI 的算法。我们证明,SLUCB-QVI 和 RSLUCB-QVI 在无一例安全违规的同时,实现了 O~(κd3H3T)\tilde{\mathcal{O}}\left(\kappa\sqrt{d^3H^3T}\right) 的后悔值,几乎匹配最先进的非安全算法的水平,其中 HH 为每片段的时长,dd 为特征映射的维度,κ\kappa 为刻画安全约束的常数,TT 为动作执行的总次数。我们进一步给出了印证理论发现的数值模拟。

关键词

引用

@article{arxiv.2106.06239,
  title  = {Safe Reinforcement Learning with Linear Function Approximation},
  author = {Sanae Amani and Christos Thrampoulidis and Lin F. Yang},
  journal= {arXiv preprint arXiv:2106.06239},
  year   = {2021}
}