实现平均奖励 Q 学习的 $\varepsilon^{-2}$ 依赖性:基于新收敛原理
机器学习
2026-01-30 v1 机器学习
摘要
本文提出了同步 Q 学习和异步 Q 学习的收敛速度分析,针对平均奖励马尔可夫决策过程(MDP),其中缺乏收敛性构成了根本性挑战。现有非渐近结果通过强制半范数收敛或依赖折扣/序列马尔可夫决策过程作为 successive 近似来克服这一挑战,这些方法要么需要未知参数,要么导致次优样本复杂度。本文在可达性假设下,建立了简单变体的同步和异步 Q 学习的最优 样本复杂度保证(考虑对数因子),该变体从懒惰动力学中进行采样,即系统以固定概率保持在当前状态。我们分析的核心在于构建实例依赖的半范数,并证明在马尔可夫决策过程进行懒惰变换后,Bellman 算子在该半范数下具有一步收敛性。
引用
@article{arxiv.2601.21301,
title = {Achieving $\varepsilon^{-2}$ Dependence for Average-Reward Q-Learning with a New Contraction Principle},
author = {Zijun Chen and Zaiwei Chen and Nian Si and Shengbo Wang},
journal= {arXiv preprint arXiv:2601.21301},
year = {2026}
}