中文

基于拓扑引导的演员-评论家模块化学习求解带时序目标的连续系统

人工智能 2023-04-21 v1 最优化与控制

摘要

本文研究了在给定线性时序逻辑高层规范下连续状态随机动态系统的形式化策略综合。为学习最大化满足概率的最优策略,我们将动态系统与翻译得到的自动机取积,构建积系统并在其上求解最优规划问题。由于该积系统具有混合积状态空间从而导致奖励稀疏,我们引入了一种广义最优备份顺序——与拓扑顺序相反——以引导值备份并加速学习过程。我们给出了在该最优规划问题中使用广义最优备份顺序的最优性证明。此外,本文提出了一种在拓扑顺序适用时的演员-评论家强化学习算法。该算法利用先进的数学技术并具备超参数自调谐特性。我们给出了所提强化学习算法的最优性与收敛性证明。我们使用神经网络来逼近混合积状态空间的值函数与策略函数。进一步,我们观察到为自动机状态分配整数编号会对神经网络逼近的值或策略函数产生排序作用。为打破这种序关系,我们对每个自动机状态的值(策略)函数使用独立的神经网络,称为模块化学习。我们进行了两组实验。首先,为展示我们强化学习算法的有效性,我们在经典控制任务 CartPole 上与基线方法进行比较。其次,我们在带时序规范的 Dubins 小车运动规划上展示了我们形式化策略综合框架的经验性能。

关键词

引用

@article{arxiv.2304.10041,
  title  = {Topological Guided Actor-Critic Modular Learning of Continuous Systems with Temporal Objectives},
  author = {Lening Li and Zhentian Qian},
  journal= {arXiv preprint arXiv:2304.10041},
  year   = {2023}
}

备注

15 pages, 9 figures