基于线性函数逼近的安全强化学习
机器学习
2021-06-14 v1 机器学习
摘要
近年来,强化学习中的安全性变得愈发重要。然而,现有方案要么无法严格避免选择不安全动作(可能在安全关键系统中导致灾难性后果),要么无法为需要学习安全约束的设置提供后悔界保证。在本文中,我们首先将安全性建模为状态与动作的未知线性代价函数,该函数必须始终低于某一阈值,从而解决上述两个问题。随后,我们针对具有线性函数逼近的片段式马尔可夫决策过程(MDP)提出称为 SLUCB-QVI 和 RSLUCB-QVI 的算法。我们证明,SLUCB-QVI 和 RSLUCB-QVI 在无一例安全违规的同时,实现了 的后悔值,几乎匹配最先进的非安全算法的水平,其中 为每片段的时长, 为特征映射的维度, 为刻画安全约束的常数, 为动作执行的总次数。我们进一步给出了印证理论发现的数值模拟。
引用
@article{arxiv.2106.06239,
title = {Safe Reinforcement Learning with Linear Function Approximation},
author = {Sanae Amani and Christos Thrampoulidis and Lin F. Yang},
journal= {arXiv preprint arXiv:2106.06239},
year = {2021}
}