中文

基于强化学习的运行时安全保障

机器学习 2020-10-22 v1 人工智能 系统与控制 系统与控制

摘要

非谱系自动驾驶仪(autopilot)的适航性与安全性必须得到验证,但形式化验证的成本可能高得令人望而却步。我们可以通过引入运行时安全保障(RTSA)作为确保安全性的机制,来规避对非谱系组件的形式化验证。RTSA 由一个元控制器组成,该元控制器观察非谱系组件的输入与输出,并在系统运行过程中形式化地验证指定的行为。当系统被触发时,将部署一个经过验证的恢复控制器。恢复控制器被设计为安全的,但极有可能干扰系统的运行目标,因此 RTSA 系统必须在安全性与效率之间取得平衡。本文的目标是设计一个能够高精度识别不安全状况的元控制器。现代控制器所部署的高维非线性动力学,以及标称控制器的黑盒特性,使得这一问题十分困难。现有方法严重依赖领域专业知识与人工工程设计。我们将 RTSA 的设计构建为马尔可夫决策过程(MDP)框架,并使用强化学习(RL)来求解。在我们的实验中,所学得的元控制器相比人工工程设计的基线方法始终表现出更优的性能。

关键词

引用

@article{arxiv.2010.10618,
  title  = {Runtime Safety Assurance Using Reinforcement Learning},
  author = {Christopher Lazarus and James G. Lopez and Mykel J. Kochenderfer},
  journal= {arXiv preprint arXiv:2010.10618},
  year   = {2020}
}