中文

CUP:一种用于安全强化学习的保守更新策略算法

机器学习 2022-02-16 v1 人工智能

摘要

安全强化学习(RL)仍极具挑战性,因为它要求智能体同时考虑回报最大化与安全探索。本文中,我们提出 CUP,一种具有理论安全性保证的保守更新策略(Conservative Update Policy)算法。我们基于新提出的性能界与替代函数推导了 CUP。尽管使用界作为替代函数设计安全 RL 算法已见于部分现有工作,我们在至少三方面对其进行了发展:(i)我们提供严格理论分析,将替代函数推广至广义优势估计(GAE)。GAE 在经验上显著降低了方差,同时保持可容忍水平的偏差,这是我们设计 CUP 的高效步骤;(ii)所提界比现有工作更紧,即使用所提界作为替代函数是对目标与安全约束更好的局部近似;(iii)所提 CUP 通过一阶优化器提供了非凸实现,不依赖于任何凸近似。最后,大量实验表明 CUP 在智能体满足安全约束时的有效性。我们已在 https://github.com/RL-boxes/Safe-RL 开源 CUP 代码。

关键词

引用

@article{arxiv.2202.07565,
  title  = {CUP: A Conservative Update Policy Algorithm for Safe Reinforcement Learning},
  author = {Long Yang and Jiaming Ji and Juntao Dai and Yu Zhang and Pengfei Li and Gang Pan},
  journal= {arXiv preprint arXiv:2202.07565},
  year   = {2022}
}