基于学习的带LTL规约的半马尔可夫决策过程有界合成
系统与控制
2022-04-12 v1 形式语言与自动机理论
系统与控制
摘要
本文提出一种针对带线性时序逻辑(LTL)规约的半马尔可夫决策过程(SMDP)的基于学习的有界合成方法。在SMDP与由LTL规约转换得到的确定性-co-Büchi自动机(dcBA)的乘积中,我们基于强化学习和贝叶斯推断学习满足LTL规约的获胜区域及其内部动态。然后,我们合成一个满足以下两个条件的优化策略。(1) 最大化到达获胜区域的概率。(2) 最小化获胜区域内驻留时间的长期风险。长期风险的最小化基于估计的动态和值迭代完成。我们证明,若折扣因子充分接近1,则随着探索获得的数据量趋于无穷,合成策略收敛于最优策略。
引用
@article{arxiv.2204.04383,
title = {Learning-based Bounded Synthesis for Semi-MDPs with LTL Specifications},
author = {Ryohei Oura and Toshimitsu Ushio},
journal= {arXiv preprint arXiv:2204.04383},
year = {2022}
}
备注
6apges, 4figures