中文

一般空间 MDP 的 Q 学习:基于弱连续性量化的收敛性与近最优性

机器学习 2023-09-08 v3 系统与控制 系统与控制

摘要

强化学习算法通常要求马尔可夫决策过程(MDPs)(亦称受控马尔可夫链)的状态与动作空间有限,文献中已作出多种努力以使此类算法适用于连续状态与动作空间。在本文中,我们表明在非常温和的正则性条件下(特别地,仅涉及 MDP 转移核的弱连续性),通过状态与动作量化(称为量化 Q 学习)的标准 Borel MDP 的 Q 学习收敛到某个极限,并且该极限满足最优性方程,从而带来具有显式性能界或保证渐近最优的近最优性。我们的方法建立在以下基础上:(i)将量化视为测量核,从而将量化 MDP 视为部分可观测马尔可夫决策过程(POMDP);(ii)利用 POMDP 的 Q 学习近最优性与收敛性结果;(iii)最后,具有弱连续核的 MDP 的有限状态模型近似的近最优性,我们证明其对应于所构造 POMDP 的不动点。因此,我们的论文给出了 Q 学习用于连续 MDP 适用性的非常一般的收敛与近似结果。

关键词

引用

@article{arxiv.2111.06781,
  title  = {Q-Learning for MDPs with General Spaces: Convergence and Near Optimality via Quantization under Weak Continuity},
  author = {Ali Devran Kara and Naci Saldi and Serdar Yüksel},
  journal= {arXiv preprint arXiv:2111.06781},
  year   = {2023}
}