中文

强化学习中在线 actor-critic 算法 ODE 极限的全局收敛性

机器学习 2023-09-20 v2 最优化与控制 机器学习

摘要

Actor-critic 算法在强化学习中应用广泛,但由于非独立同分布数据样本的在线到达,其数学分析颇具挑战。数据样本的分布随模型更新而动态变化,在数据分布与强化学习算法之间引入了复杂的反馈回路。我们证明,在时间重标度下,具有表格参数化的在线 actor-critic 算法在更新次数趋于无穷时收敛到常微分方程(ODE)。证明首先建立了固定 actor 策略下数据样本的几何遍历性。随后,利用泊松方程,我们证明数据样本围绕动态概率测度(其为演化中 actor 模型的函数)的波动随更新次数增大而消失。一旦导出 ODE 极限,我们采用双时间尺度分析研究其收敛性质,该分析在渐近意义上将 critic ODE 与 actor ODE 解耦。我们证明了 critic 收敛到 Bellman 方程的解、actor 收敛到最优策略。此外,还建立了到该全局最小值的收敛速率。我们的收敛分析在 actor-critic 算法中学习率和探索率的特定选择下成立,这可为实际应用中 actor-critic 算法的实现提供指导。

关键词

引用

@article{arxiv.2108.08655,
  title  = {Global Convergence of the ODE Limit for Online Actor-Critic Algorithms in Reinforcement Learning},
  author = {Ziheng Wang and Justin Sirignano},
  journal= {arXiv preprint arXiv:2108.08655},
  year   = {2023}
}