中文

具有 LTL 规范的随机离散事件系统监督器的有界综合与强化学习

系统与控制 2022-04-12 v3 形式语言与自动机理论 系统与控制

摘要

本文中,我们考虑线性时序逻辑规范下随机离散事件系统(SDESs)的监督控制。应用有界综合,我们将监督器综合化简为满足安全条件的问题。首先,我们考虑利用安全条件综合有向控制器的问题。我们对不安全状态赋予负奖励,并引入带状态依赖折扣因子的期望回报。我们利用动态规划方法计算获胜区域和具有最大满足概率的有向控制器,其中期望回报被用作值函数。接下来,我们通过最优值函数构造许可监督器。我们证明该监督器在获胜区域内实现最大满足概率并最大化可达集。最后,对于未知的 SDES,我们提出一种两阶段无模型强化学习方法,用于高效学习获胜区域和具有最大满足概率的有向控制器。我们还通过仿真证明了所提方法的有效性。

关键词

引用

@article{arxiv.2105.03081,
  title  = {Bounded Synthesis and Reinforcement Learning of Supervisors for Stochastic Discrete Event Systems with LTL Specifications},
  author = {Ryohei Oura and Toshimitsu Ushio and Ami Sakakibara},
  journal= {arXiv preprint arXiv:2105.03081},
  year   = {2022}
}

备注

15 pages, 4 figures, 2 tables, submitted to a journal