基于原始对偶策略优化的可证明高效安全探索
机器学习
2020-10-27 v2 最优化与控制
机器学习
摘要
我们研究使用约束马尔可夫决策过程(CMDP)公式的安全强化学习(SRL)问题,其中智能体旨在最大化期望总奖励,并受限于效用函数期望总价值的安全约束。我们关注具有函数逼近的片段式设定,其中马尔可夫转移核具有线性结构,但不对采样模型施加任何额外假设。由于需要将安全约束和函数逼近同时纳入基本的利用/探索权衡,在此设定下设计具有可证明计算和统计效率的 SRL 算法尤其具有挑战性。为此,我们提出一种乐观原始-对偶近端策略优化(OPDOP)算法,其中值函数通过结合最小二乘策略评估和用于安全探索的额外奖励项来估计。我们证明所提算法达到 的遗憾和 的约束违反,其中 是特征映射的维度, 是每个片段的步数 horizon, 是总步数。这些界在奖励/效用函数固定但每个片段后的反馈为 bandit 时成立。我们的界仅通过特征映射的维度依赖于状态-动作空间的容量,因此即使状态数量趋于无穷我们的结果也成立。据我们所知,我们提供了首个在函数逼近设定下用于 CMDP 安全探索的可证明高效在线策略优化算法。
引用
@article{arxiv.2003.00534,
title = {Provably Efficient Safe Exploration via Primal-Dual Policy Optimization},
author = {Dongsheng Ding and Xiaohan Wei and Zhuoran Yang and Zhaoran Wang and Mihailo R. Jovanović},
journal= {arXiv preprint arXiv:2003.00534},
year = {2020}
}
备注
44 pages. We have revised the linear MDP assumption and fixed a bug in our previous proofs