中文

基于李雅普诺夫方法的连续控制安全策略优化

机器学习 2019-02-13 v2 人工智能 机器学习

摘要

我们研究连续动作强化学习问题,其中关键在于智能体仅通过安全策略与环境交互,即不会将智能体带入不良状态的策略。我们将这些问题表述为约束马尔可夫决策过程(CMDPs),并提出了基于李雅普诺夫方法的安全策略优化算法来求解它们。我们的算法可以使用任何标准的策略梯度(PG)方法,例如深度确定性策略梯度(DDPG)或近端策略优化(PPO),来训练神经网络策略,同时通过要么将策略参数要么将动作投影到由状态相关的线性化李雅普诺夫约束所诱导的可行解集合上,保证每次策略更新都近似满足约束。与现有的约束 PG 算法相比,我们的算法数据效率更高,因为它们能够同时利用同策略和异策略数据。此外,我们的动作投影算法通常导致较不保守的策略更新,并允许自然集成到端到端的 PG 训练流程中。我们在多个模拟(MuJoCo)任务以及真实的室内机器人导航问题上评估了我们的算法,并与最先进的基线进行了比较,证明了它们在平衡性能与约束满足方面的有效性。实验视频可在以下链接查看:https://drive.google.com/file/d/1pzuzFqWIE710bE2U6DmS59AfRzqK2Kek/view?usp=sharing。

关键词

引用

@article{arxiv.1901.10031,
  title  = {Lyapunov-based Safe Policy Optimization for Continuous Control},
  author = {Yinlam Chow and Ofir Nachum and Aleksandra Faust and Edgar Duenez-Guzman and Mohammad Ghavamzadeh},
  journal= {arXiv preprint arXiv:1901.10031},
  year   = {2019}
}