中文

平均奖励马尔可夫决策过程价值迭代的最优非渐近收敛率

最优化与控制 2026-02-10 v2

摘要

虽然关于折扣累积奖励马尔可夫决策过程 (MDP) 价值迭代 (VI) 的研究已广泛,但关于对平均奖励 (无折扣) MDP 的 VI 分析工作仍有限,大多数先前结果仅关注以 Bellman 误差为度量的渐进收敛率。本文对平均奖励 MDP 的非渐近分析进行了细致的梳理,获得了一系列收敛结果,深化了对该设置的理解。其中最突出的新结果包括:在多链 setup 下,锚定价值迭代 (Anchored Value Iteration) 对于 Bellman 误差的 O(1/k)\mathcal{O}(1/k) 收敛率;以及在弱通信和单链 setup 中的基于 span 的复杂度下界,可匹配 O(1/k)\mathcal{O}(1/k) 上界,仅差一个常数因子 88

关键词

引用

@article{arxiv.2504.09913,
  title  = {Optimal Non-Asymptotic Rates of Value Iteration for Average-Reward Markov Decision Processes},
  author = {Jongmin Lee and Ernest K. Ryu},
  journal= {arXiv preprint arXiv:2504.09913},
  year   = {2026}
}