中文

基于无模型强化学习的连续空间MDP形式化控制器综合

网络与互联网体系结构 2020-11-18 v4

摘要

提出了一种用于综合连续空间马尔可夫决策过程(MDPs)策略的新型强化学习方案。该方案使得能够将用于有限MDP的无模型、现成强化学习算法应用于计算相应连续空间MDP的最优策略,而无需显式构建有限状态抽象。所提方法基于用具有未知转移概率的有限MDP(不显式构建)对系统进行抽象、在抽象MDP上综合策略,然后将结果映射回具体连续空间MDP并带有近似最优性保证。系统感兴趣的性质属于线性时序逻辑的一个片段,称为句法共安全线性时序逻辑(scLTL),综合要求是在给定有界时间范围内最大化满足概率。本文的一个关键贡献是利用有限MDP上强化学习的经典收敛结果,提供在未知连续空间MDP上最大化满足概率的控制策略,同时提供概率接近性保证。基于自动机的奖励函数通常稀疏;我们提出了一种新型基于势的奖励塑形技术以产生稠密奖励来加速学习。所提方法的有效性通过将其应用于三个物理基准得到证明,涉及房间温度调节、道路交通单元控制以及BMW 320i汽车的7维非线性模型控制。

关键词

引用

@article{arxiv.2003.00713,
  title  = {Optimal Deployment of Tethered Drones for Maximum Cellular Coverage in User Clusters},
  author = {Osama M. Bushnaq and Mustafa A. Kishk and Abdulkadir Çelik and Mohamed-Slim Alouini and Tareq Y. Al-Naffouri},
  journal= {arXiv preprint arXiv:2003.00713},
  year   = {2020}
}

备注

Accepted at the IEEE Transaction on Wireless Communications