中文

直接学习最优控制策略的通用马尔可夫决策过程框架

机器学习 2021-04-02 v2 最优化与控制 机器学习

摘要

我们考虑一种基于直接学习最优控制策略机会的新型强化学习(RL)形式,以及为支持这些机会而设计的通用马尔可夫决策过程(MDP)框架。我们推导了基于控制的RL方法的通用类别,以及在学习和应用最优控制策略过程中随时间推移的探索与利用形式。我们的通用MDP框架通过推广任意给定状态下策略的定义和范围,扩展了经典的Bellman算子和最优性准则。我们通过这一通用MDP框架,确立了基于控制的方法的收敛性和最优性——包括在各种控制范式(例如分段线性控制策略)中以及一般情况下的收敛性,包括在我们的MDP框架背景下 QQ-learning 的收敛性。我们的实证结果证明并量化了该方法的显著优势。

关键词

引用

@article{arxiv.1905.12009,
  title  = {A General Markov Decision Process Framework for Directly Learning Optimal Control Policies},
  author = {Yingdong Lu and Mark S. Squillante and Chai Wah Wu},
  journal= {arXiv preprint arXiv:1905.12009},
  year   = {2021}
}