面向概率可达性与安全性规范的安全强化学习:一种基于李雅普诺夫的方法
机器人学
2020-02-25 v1 人工智能
系统与控制
系统与控制
摘要
机器人与自主系统中的新兴应用,如自动驾驶与机器人手术,常常涉及关键的安全约束,即便在系统模型信息有限的情况下也必须满足。为此,我们提出一种无模型安全规范方法,通过谨慎结合概率可达性分析与安全强化学习(RL)来学习安全操作的最大概率。我们的方法针对安全策略构造李雅普诺夫函数,以约束每个策略改进阶段。由此得到一系列安全策略,这些策略确定了称为安全集的安全操作范围,该安全集单调扩张并逐步收敛。我们还开发了一种高效的安全探索方案,加速判定未考察状态安全性的过程。利用李雅普诺夫屏蔽,我们的方法以高置信度调节探索策略以避免危险状态。为处理高维系统,我们进一步通过引入拉格朗日松弛技术将方法扩展至深度RL,以建立可解的 actor-critic 算法。我们的方法在连续控制基准问题上展示了经验性能,例如平面机械臂的到达任务。
引用
@article{arxiv.2002.10126,
title = {Safe reinforcement learning for probabilistic reachability and safety specifications: A Lyapunov-based approach},
author = {Subin Huh and Insoon Yang},
journal= {arXiv preprint arXiv:2002.10126},
year = {2020}
}