中文

基于 Robbins-Siegmund 定理的强化学习扩展及其应用

机器学习 2026-05-28 v2 最优化与控制

摘要

Robbins-Siegmund 定理 estabished 随机过程(几乎超鞅)的收敛,是随机逼近和强化学习 (RL) 中分析随机迭代算法最常用的方法之一。然而,其原始形式存在显著局限,要求零阶项可 summable。在许多重要 RL 应用中,无法满足此可 summable 条件。这一局限性促使我们扩展 Robbins-Siegmund 定理以适用于几乎超鞅情形,其中零阶项不可 summable,但仅可 square-summable。具体而言,我们引入一种新颖且温和的假设关于随机过程的增量。这结合 square-summable 条件,使几乎必然收敛于有界集合。此外,我们进一步提供了几乎必然收敛速率、高概率浓度界限以及 LpL^p 收敛速率。我们随后将新结果应用于随机逼近和 RL。显著的是,我们获得了线性函数逼近 QQ-学习的首个几乎必然收敛速率、首个高概率浓度界限以及首个 LpL^p 收敛速率。

关键词

引用

@article{arxiv.2509.26442,
  title  = {Extensions of Robbins-Siegmund Theorem with Applications in Reinforcement Learning},
  author = {Xinyu Liu and Zixuan Xie and Shangtong Zhang},
  journal= {arXiv preprint arXiv:2509.26442},
  year   = {2026}
}