具有任意范数收缩和马尔可夫噪声的两时刻随机逼近的有限时间界限
机器学习
2025-09-30 v2 系统与控制
系统与控制
最优化与控制
机器学习
摘要
两时刻随机逼近(SA)是一种迭代算法,广泛应用于强化学习和优化。先前的有限时间分析仅针对以欧几里得范数收敛的固定点迭代。为了迎合强化学习中的应用,本文给出非线性两时刻SA的首个均方误差界,其中迭代具有任意范数收缩映射和马尔可夫噪声。我们证明均方误差在一般情况下以 的速率衰减,在较慢时刻无噪声的特殊情况下,以 的速率衰减。我们的分析使用广义莫罗-威尔封闭函数处理任意范数收缩,并通过求解泊松方程处理马尔可夫噪声。通过分析SSP Q学习算法,给出基于平均奖励准则下异步MDP控制算法的首个 界。我们也获得多项Q学习(带Polyak平均)的 速率,并提供一种收敛于强单调性博弈广义纳什均衡的算法,其收敛速率为 。
引用
@article{arxiv.2503.18391,
title = {Finite-Time Bounds for Two-Time-Scale Stochastic Approximation with Arbitrary Norm Contractions and Markovian Noise},
author = {Siddharth Chandak and Shaan Ul Haque and Nicholas Bambos},
journal= {arXiv preprint arXiv:2503.18391},
year = {2025}
}
备注
To be presented at IEEE Conference on Decision and Control (CDC) 2025