基于光滑凸包络的随机逼近有限样本分析
机器学习
2021-07-01 v6 最优化与控制
机器学习
摘要
随机逼近(SA)是一种求解信息被噪声污染的不动点方程的流行方法。本文中,我们考虑涉及关于任意范数的压缩映射的 SA,并给出其在使用不同步长时的有限样本误差界。思路是利用广义 Moreau 包络构造光滑 Lyapunov 函数,并表明 SA 的迭代相对于该 Lyapunov 函数具有负漂移。我们的结果适用于强化学习(RL)。特别地,我们用它建立了 off-policy TD-learning 的 V-trace 算法的首个已知收敛速率。此外,我们也用它研究 on-policy 设定下的 TD-learning,并恢复了 -learning 现有的最先进结果。重要的是,我们的构造使得收敛界对状态空间大小的依赖仅为对数级。
引用
@article{arxiv.2002.00874,
title = {Finite-Sample Analysis of Stochastic Approximation Using Smooth Convex Envelopes},
author = {Zaiwei Chen and Siva Theja Maguluri and Sanjay Shakkottai and Karthikeyan Shanmugam},
journal= {arXiv preprint arXiv:2002.00874},
year = {2021}
}