具有延迟更新的随机逼近:马尔可夫采样下的有限时间速率
机器学习
2024-03-28 v3 人工智能
多智能体系统
系统与控制
系统与控制
最优化与控制
摘要
受大规模和多智能体强化学习应用的启发,我们研究了马尔可夫采样下具有延迟更新的随机逼近(SA)方案的非渐近性能。虽然延迟对优化的影响已被广泛研究,但它们如何与底层马尔可夫过程相互作用以塑造 SA 的有限时间性能仍知之甚少。在此背景下,我们的第一个主要贡献是表明,在时变有界延迟下,延迟 SA 更新规则保证了最后一次迭代指数级快速收敛到 SA 算子不动点周围的球域。值得注意的是,我们的界限在对最大延迟 和混合时间 的依赖性上是紧的。为了达到这个紧界,我们开发了一种新的归纳证明技术,与各种现有的延迟优化分析不同,该技术依赖于建立迭代的均匀有界性。因此,我们的证明可能具有独立兴趣。接下来,为了减轻最大延迟对收敛速率的影响,我们提供了马尔可夫采样下延迟自适应 SA 方案的首个有限时间分析。特别是,我们表明该方案的收敛指数按比例缩小为 ,而不是普通延迟 SA 规则的 ;此处 表示所有迭代的平均延迟。此外,自适应方案不需要关于延迟序列的先验知识来进行步长调整。我们的理论发现阐明了一大类算法(包括马尔可夫采样下的 TD 学习、Q 学习和随机梯度下降)中延迟的有限时间效应。
引用
@article{arxiv.2402.11800,
title = {Stochastic Approximation with Delayed Updates: Finite-Time Rates under Markovian Sampling},
author = {Arman Adibi and Nicolo Dal Fabbro and Luca Schenato and Sanjeev Kulkarni and H. Vincent Poor and George J. Pappas and Hamed Hassani and Aritra Mitra},
journal= {arXiv preprint arXiv:2402.11800},
year = {2024}
}
备注
Accepted to the 27th International Conference on Artificial Intelligence and Statistics (AISTATS) 2024!