中文

平均代价准则下连续状态与动作 MDP 的 Q-Learning

最优化与控制 2024-12-10 v3 系统与控制 系统与控制

摘要

对于无限时域平均代价准则问题,严格意义上的逼近与强化学习结果相对较少。本文针对具有标准 Borel 空间的马尔可夫决策过程(MDP),(i)首先给出了平均代价准则下连续空间 MDP 基于离散化的逼近方法,并在一定遍历性假设下,当动态仅弱连续(网格尺寸趋于零时误差的渐近收敛)或 Wasserstein 连续(网格尺寸趋于零时逼近的收敛速率)时给出了逼近的误差界。特别地,我们将先前工作中的全变差条件放宽至弱连续或 Wasserstein 连续。(ii)我们通过量化给出了连续空间的同步与异步(量化)Q-learning 算法(在文中给出的相应 Q-learning 算法中,量化状态被视为实际状态),并建立了其收敛性。(iii)我们最后证明该收敛性指向通过量化构造的有限近似模型的最优 Q 值,这意味着所得解的近最优性。据我们所知,我们的 Q-learning 收敛结果及其向近最优性的收敛对于连续空间是新的,且证明方法即便对有限空间也是新的。

关键词

引用

@article{arxiv.2308.07591,
  title  = {Q-Learning for Continuous State and Action MDPs under Average Cost Criteria},
  author = {Ali Devran Kara and Serdar Yuksel},
  journal= {arXiv preprint arXiv:2308.07591},
  year   = {2024}
}

备注

3 figures