重访价值迭代:折扣奖励与平均奖励情况的统一分析
机器学习
2026-03-12 v2
摘要
价值迭代(VI)是强化学习中最基本的算法之一,其理论收敛保证仍显示出与实证行为的持续性不匹配。在折扣奖励情况下,经典理论保证以γ为收敛率的几何收敛;而在平均奖励情况下,最近的工作表明只能期待亚线性收敛。然而,在实际应用中,VI往往被观察到显著更快地收敛。本文通过统一的几何分析表明,在唯一且单链最优策略的假设下,(i)折扣和平均奖励两种情形下的收敛均为几何级数,(ii)收敛速度快于以前的分析所暗示的。
引用
@article{arxiv.2510.23914,
title = {Revisiting Value Iteration: Unified Analysis of Discounted and Average-Reward Cases},
author = {Arsenii Mustafin and Xinyi Sheng and Dominik Baumann},
journal= {arXiv preprint arXiv:2510.23914},
year = {2026}
}
备注
22 pages, 2 figure