CRPO:一种具有收敛保证的安全强化学习新方法
机器学习
2021-06-01 v3 机器学习
摘要
在安全强化学习(SRL)问题中,智能体探索环境以最大化期望总奖励,同时避免违反若干期望总成本上的约束。一般而言,此类 SRL 问题具有受多个非凸约束限制的非凸目标函数,因此非常难以求解,尤其是难以给出全局最优策略。许多流行的 SRL 算法采用原始-对偶结构,利用对偶变量的更新来满足约束。相反,我们提出一种称为约束修正策略优化(CRPO)的原始方法,该方法在目标改进与约束满足之间交替更新策略。CRPO 提供了一个原始类型的算法框架来求解 SRL 问题,其中每次策略更新可采取任意变体的策略优化步。为展示 CRPO 的理论性能,我们采用自然策略梯度(NPG)作为每次策略更新步,并证明 CRPO 在约束策略集中达到 的收敛速率至全局最优策略,且在约束满足上达到 的误差界。这是对具有全局最优性保证的原始 SRL 算法的首个有限时间分析。我们的实证结果表明,CRPO 可显著优于现有的原始-对偶基线算法。
引用
@article{arxiv.2011.05869,
title = {CRPO: A New Approach for Safe Reinforcement Learning with Convergence Guarantee},
author = {Tengyu Xu and Yingbin Liang and Guanghui Lan},
journal= {arXiv preprint arXiv:2011.05869},
year = {2021}
}
备注
Published in ICML 2021