中文

带时序逻辑约束的强化学习用于部分可观测马尔可夫决策过程

机器人学 2021-04-06 v1

摘要

本文提出了一种强化学习方法,用于在未知且部分可观测的环境中,针对具有主观时间相关安全约束的自主系统进行控制器综合。在数学上,我们通过具有未知转移/观测概率的部分可观测马尔可夫决策过程(POMDP)对系统动力学进行建模。时间相关安全约束由 iLTL(线性时序逻辑在状态分布上的一种变体)刻画。我们的强化学习方法首先构建 POMDP 的信念 MDP,以捕捉估计状态分布的时间演化。然后,通过构建信念 MDP 与时序逻辑约束的极限确定性 Büchi 自动机(LDBA)的乘积信念 MDP,我们将 POMDP 上的时间相关安全约束转化为乘积信念 MDP 上的状态相关约束。最后,我们在状态相关约束下通过值迭代学习最优策略。

关键词

引用

@article{arxiv.2104.01612,
  title  = {Reinforcement Learning with Temporal Logic Constraints for Partially-Observable Markov Decision Processes},
  author = {Yu Wang and Alper Kamil Bozkurt and Miroslav Pajic},
  journal= {arXiv preprint arXiv:2104.01612},
  year   = {2021}
}