平均奖励马尔可夫决策过程价值迭代的最优非渐近收敛率
最优化与控制
2026-02-10 v2
摘要
虽然关于折扣累积奖励马尔可夫决策过程 (MDP) 价值迭代 (VI) 的研究已广泛,但关于对平均奖励 (无折扣) MDP 的 VI 分析工作仍有限,大多数先前结果仅关注以 Bellman 误差为度量的渐进收敛率。本文对平均奖励 MDP 的非渐近分析进行了细致的梳理,获得了一系列收敛结果,深化了对该设置的理解。其中最突出的新结果包括:在多链 setup 下,锚定价值迭代 (Anchored Value Iteration) 对于 Bellman 误差的 收敛率;以及在弱通信和单链 setup 中的基于 span 的复杂度下界,可匹配 上界,仅差一个常数因子 。
引用
@article{arxiv.2504.09913,
title = {Optimal Non-Asymptotic Rates of Value Iteration for Average-Reward Markov Decision Processes},
author = {Jongmin Lee and Ernest K. Ryu},
journal= {arXiv preprint arXiv:2504.09913},
year = {2026}
}