中文

基于学习的带LTL规约的半马尔可夫决策过程有界合成

系统与控制 2022-04-12 v1 形式语言与自动机理论 系统与控制

摘要

本文提出一种针对带线性时序逻辑(LTL)规约的半马尔可夫决策过程(SMDP)的基于学习的有界合成方法。在SMDP与由LTL规约转换得到的确定性KK-co-Büchi自动机(dKKcBA)的乘积中,我们基于强化学习和贝叶斯推断学习满足LTL规约的获胜区域及其内部动态。然后,我们合成一个满足以下两个条件的优化策略。(1) 最大化到达获胜区域的概率。(2) 最小化获胜区域内驻留时间的长期风险。长期风险的最小化基于估计的动态和值迭代完成。我们证明,若折扣因子充分接近1,则随着探索获得的数据量趋于无穷,合成策略收敛于最优策略。

关键词

引用

@article{arxiv.2204.04383,
  title  = {Learning-based Bounded Synthesis for Semi-MDPs with LTL Specifications},
  author = {Ryohei Oura and Toshimitsu Ushio},
  journal= {arXiv preprint arXiv:2204.04383},
  year   = {2022}
}

备注

6apges, 4figures