中文

实现平均奖励 Q 学习的 $\varepsilon^{-2}$ 依赖性:基于新收敛原理

机器学习 2026-01-30 v1 机器学习

摘要

本文提出了同步 Q 学习和异步 Q 学习的收敛速度分析,针对平均奖励马尔可夫决策过程(MDP),其中缺乏收敛性构成了根本性挑战。现有非渐近结果通过强制半范数收敛或依赖折扣/序列马尔可夫决策过程作为 successive 近似来克服这一挑战,这些方法要么需要未知参数,要么导致次优样本复杂度。本文在可达性假设下,建立了简单变体的同步和异步 Q 学习的最优 O~(ε2)\widetilde{O}(\varepsilon^{-2}) 样本复杂度保证(考虑对数因子),该变体从懒惰动力学中进行采样,即系统以固定概率保持在当前状态。我们分析的核心在于构建实例依赖的半范数,并证明在马尔可夫决策过程进行懒惰变换后,Bellman 算子在该半范数下具有一步收敛性。

关键词

引用

@article{arxiv.2601.21301,
  title  = {Achieving $\varepsilon^{-2}$ Dependence for Average-Reward Q-Learning with a New Contraction Principle},
  author = {Zijun Chen and Zaiwei Chen and Nian Si and Shengbo Wang},
  journal= {arXiv preprint arXiv:2601.21301},
  year   = {2026}
}