中文

在线神经 Actor-Critic 算法的弱收敛分析

机器学习 2026-05-28 v2 最优化与控制 概率论 机器学习

摘要

我们证明,使用在线 actor-critic 算法训练的单层神经网络,当隐藏单元数量和训练步数 \rightarrow \infty 时,在分布上收敛于一个随机常微分方程(ODE)。在在线 actor-critic 算法中,数据样本的分布随着模型的更新而动态变化,这是任何收敛分析面临的关键挑战。我们建立了在固定 actor 策略下数据样本的几何遍历性。然后,利用泊松方程,我们证明了由于随机到达的数据样本导致的模型更新围绕极限分布的波动,在参数更新次数 \rightarrow \infty 时消失。利用泊松方程和弱收敛技术,我们证明了 actor 神经网络和 critic 神经网络收敛于具有随机初始条件的 ODE 系统的解。对极限 ODE 的分析表明,极限 critic 网络将收敛到真实价值函数,这将为 actor 提供策略梯度的渐近无偏估计。我们随后证明极限 actor 网络将收敛到一个驻点。

关键词

引用

@article{arxiv.2403.16825,
  title  = {Weak Convergence Analysis of Online Neural Actor-Critic Algorithms},
  author = {Samuel Chun-Hei Lam and Justin Sirignano and Ziheng Wang},
  journal= {arXiv preprint arXiv:2403.16825},
  year   = {2026}
}