一种基于李雅普诺夫方法的安全强化学习途径
机器学习
2018-05-22 v1 人工智能
机器学习
摘要
在许多现实世界的强化学习(RL)问题中,除了优化主目标函数外,智能体还必须同时避免违反若干约束。特别是,除了优化性能外,保证智能体在训练以及部署期间的安全至关重要(例如,机器人应避免采取——探索性或非探索性——会不可挽回地损害其硬件的动作)。为将安全性引入 RL,我们在约束马尔可夫决策问题(CMDPs)框架下推导算法,CMDPs 是标准马尔可夫决策问题(MDPs)的扩展,增加了对期望累积代价的约束。我们的方法依赖于一种新颖的李雅普诺夫(Lyapunov)方法。我们定义并给出了一种构造李雅普诺夫函数的方法,其通过一组局部线性约束有效保证训练期间行为策略的全局安全。利用这些理论基础,我们展示了如何使用李雅普诺夫方法将动态规划(DP)和 RL 算法系统地转化为其安全对应版本。为说明其有效性,我们在安全基准域上的若干 CMDP 规划与决策任务中评估了这些算法。我们的结果表明,所提方法在平衡约束满足与性能方面显著优于现有基线。
引用
@article{arxiv.1805.07708,
title = {A Lyapunov-based Approach to Safe Reinforcement Learning},
author = {Yinlam Chow and Ofir Nachum and Edgar Duenez-Guzman and Mohammad Ghavamzadeh},
journal= {arXiv preprint arXiv:1805.07708},
year = {2018}
}