从集合收敛到点收敛: 带自适应步长的平均奖励 Q 学习的有限时间保证
机器学习
2026-04-07 v2 概率论
机器学习
摘要
本 work 提出了对平均奖励 -学习最后一个迭代收敛的首次有限时间分析, 其异步实现的一个关键特征是使用自适应步长, 作为每个状态-动作对的局部时钟。 我们表明, 在适当假设下, 该 -学习算法生成的迭代以 的速率(在均方意义上)收敛到最优 -函数, 使用跨越 seminorm。 此外, 通过在算法中添加一个中心化步骤, 我们进一步建立了以 的速率(在均方意义上)收敛到中心化最优 -函数的点意义收敛。 为证明这些结果, 我们指出, 必须使用自适应步长, 由于没有它们, 该算法无法收敛到正确的目标。 此外, 自适应步长可解释为一种形式的隐式重要抽样, 用于抵消异步更新的影响。 从技术上讲, 自适应步长的使用使每个 -学习更新依赖于整个样本历史, 引入强相关性, 使算法成为非马尔可夫随机逼近 (SA) 方案。 我们克服这一挑战的方法包括: (1) 非马尔可夫 SA 的时变马尔可夫化改造, 以及 (2) 几乎sure 时变界限、条件化论证和马尔可夫链浓度不等式的组合, 以打破自适应步长与迭代之间的强相关性。 本 work 所 developing 的工具很可能广泛适用于分析具有自适应步长的通用 SA 算法。
引用
@article{arxiv.2504.18743,
title = {From Set Convergence to Pointwise Convergence: Finite-Time Guarantees for Average-Reward Q-Learning with Adaptive Stepsizes},
author = {Zaiwei Chen and Phalguni Nanda},
journal= {arXiv preprint arXiv:2504.18743},
year = {2026}
}
备注
65 pages and 6 figures