中文

双时间尺度 Actor-Critic 方法的有限时间分析

机器学习 2022-10-11 v3 最优化与控制 机器学习

摘要

与其他强化学习算法相比,Actor-Critic(AC)方法已展现出极大的经验成功,其中 actor 使用策略梯度改进学习策略,critic 使用时序差分学习估计策略梯度。在双时间尺度学习率调度下,AC 的渐近收敛性已在文献中被充分研究。然而,actor-critic 方法的非渐近收敛与有限样本复杂度在很大程度上仍是开放问题。本工作中,我们在非独立同分布设定下为双时间尺度 actor-critic 方法提供非渐近分析。我们证明 actor-critic 方法保证能以 O~(ϵ2.5)\mathcal{\tilde{O}}(\epsilon^{-2.5}) 的样本复杂度找到非凹性能函数 J(θ)J(\boldsymbol{\theta}) 的一阶平稳点(即 J(θ)22ϵ\|\nabla J(\boldsymbol{\theta})\|_2^2 \le \epsilon)。据我们所知,这是首个为双时间尺度 actor-critic 方法提供有限时间分析与样本复杂度界的工作。

关键词

引用

@article{arxiv.2005.01350,
  title  = {A Finite Time Analysis of Two Time-Scale Actor Critic Methods},
  author = {Yue Wu and Weitong Zhang and Pan Xu and Quanquan Gu},
  journal= {arXiv preprint arXiv:2005.01350},
  year   = {2022}
}

备注

39 pages. In NeurIPS 2020