基于相对值迭代的半马尔可夫决策过程平均奖励强化学习
机器学习
2025-12-09 v1 最优化与控制
摘要
本文将作者最近在Borkar-Meyn框架下进行的异步随机逼近结果应用于半马尔可夫决策过程(SMDP)中的平均奖励强化学习。我们在有限状态空间、弱通信SMDP上建立了异步随机逼近类Schweitzer经典相对值迭代算法(RVI Q学习)的收敛性。特别是,我们证明该算法几乎必然收敛到平均奖励最优方程解的紧凑、连通子集,在额外的步长和异步条件下,收敛到唯一的样本路径依赖解。此外,为了充分利用随机逼近框架,我们引入了用于估计RVI Q学习中最优奖励率的新单调性条件。这些条件大大扩展了之前考虑的算法框架,通过RVI Q学习的稳定性和收�敛性分析中的新方法予以解决。
引用
@article{arxiv.2512.06218,
title = {Average-reward reinforcement learning in semi-Markov decision processes via relative value iteration},
author = {Huizhen Yu and Yi Wan and Richard S. Sutton},
journal= {arXiv preprint arXiv:2512.06218},
year = {2025}
}
备注
24 pages. This paper presents the reinforcement-learning material previously contained in version 2 of arXiv:2409.03915, which is now being split into two stand-alone papers. Minor corrections and improvements to the main results have also been made in the course of this reformatting