中文

基于约束更新投影的安全策略优化方法

机器学习 2022-11-10 v2 人工智能

摘要

安全强化学习(RL)研究智能体不仅需最大化奖励、还需避免探索不安全区域的问题。本研究提出 CUP,一种基于约束更新投影(Constrained Update Projection)框架、具有严格安全保证的新型策略优化方法。CUP 开发的核心是新提出的代理函数及其性能界。与以往安全 RL 方法相比,CUP 具有如下优势:1)CUP 将代理函数推广至广义优势估计器(GAE),从而获得强劲的实证性能;2)CUP 统一了性能界,为理解部分现有算法提供更好可解释性;3)CUP 仅通过一阶优化器提供非凸实现,无需对目标函数的凸性做任何强近似。为验证 CUP 方法,我们在广泛任务上将其与详尽的安全 RL 基线进行比较。实验表明 CUP 在奖励与安全约束满足方面均有效。我们已在链接 https://github.com/zmsn-2077/CUP-safe-rl 开源 CUP 代码。

关键词

引用

@article{arxiv.2209.07089,
  title  = {Constrained Update Projection Approach to Safe Policy Optimization},
  author = {Long Yang and Jiaming Ji and Juntao Dai and Linrui Zhang and Binbin Zhou and Pengfei Li and Yaodong Yang and Gang Pan},
  journal= {arXiv preprint arXiv:2209.07089},
  year   = {2022}
}

备注

Accepted by NeurIPS2022. arXiv admin note: substantial text overlap with arXiv:2202.07565