关于带 Polyak 平均的随机逼近高概率界的一般性定理
机器学习
2025-05-29 v1 机器学习
概率论
摘要
Polyak-Ruppert 平均是实现随机逼近 (SA) 算法最优渐近方差的广泛使用技术,然而其高概率性能保证在一般设定中仍未被充分探索。在本文中,我们提出了一个通用框架,用于建立平均 SA 迭代误差的非渐近集中界。我们的方法假设可以获取未平均迭代的单独集中界,并给出平均迭代的紧致界。我们还构造了一个例子,证明了我们的结果在常数乘法因子范围内是紧致的。作为直接应用,我们推导了收缩 SA 算法以及带平均的时序差分学习和 Q-learning 等算法的紧致集中界,在传统分析具有挑战性的设定中获得了新的界。
引用
@article{arxiv.2505.21796,
title = {A General-Purpose Theorem for High-Probability Bounds of Stochastic Approximation with Polyak Averaging},
author = {Sajad Khodadadian and Martin Zubeldia},
journal= {arXiv preprint arXiv:2505.21796},
year = {2025}
}
备注
37 pages