中文

CRPO:一种具有收敛保证的安全强化学习新方法

机器学习 2021-06-01 v3 机器学习

摘要

在安全强化学习(SRL)问题中,智能体探索环境以最大化期望总奖励,同时避免违反若干期望总成本上的约束。一般而言,此类 SRL 问题具有受多个非凸约束限制的非凸目标函数,因此非常难以求解,尤其是难以给出全局最优策略。许多流行的 SRL 算法采用原始-对偶结构,利用对偶变量的更新来满足约束。相反,我们提出一种称为约束修正策略优化(CRPO)的原始方法,该方法在目标改进与约束满足之间交替更新策略。CRPO 提供了一个原始类型的算法框架来求解 SRL 问题,其中每次策略更新可采取任意变体的策略优化步。为展示 CRPO 的理论性能,我们采用自然策略梯度(NPG)作为每次策略更新步,并证明 CRPO 在约束策略集中达到 O(1/T)\mathcal{O}(1/\sqrt{T}) 的收敛速率至全局最优策略,且在约束满足上达到 O(1/T)\mathcal{O}(1/\sqrt{T}) 的误差界。这是对具有全局最优性保证的原始 SRL 算法的首个有限时间分析。我们的实证结果表明,CRPO 可显著优于现有的原始-对偶基线算法。

关键词

引用

@article{arxiv.2011.05869,
  title  = {CRPO: A New Approach for Safe Reinforcement Learning with Convergence Guarantee},
  author = {Tengyu Xu and Yingbin Liang and Guanghui Lan},
  journal= {arXiv preprint arXiv:2011.05869},
  year   = {2021}
}

备注

Published in ICML 2021