中文

迈向理解异步优势 actor-critic:收敛性与线性加速

机器学习 2023-08-02 v2 最优化与控制

摘要

标准强化学习(RL)算法的异步与并行实现是现代 RL 巨大成功的关键推动因素。在众多异步 RL 算法中,可以说最流行且最有效的是异步优势 actor-critic(A3C)算法。尽管 A3C 正成为 RL 的主力,其理论性质仍未被充分理解,包括其非渐近分析以及并行带来的性能提升(即线性加速)。本文重新审视 A3C 算法并建立其非渐近收敛保证。在独立同分布和马尔可夫采样下,我们分别建立了 A3C 在一般策略近似情形下的局部收敛保证,以及在 softmax 策略参数化下的全局收敛保证。在独立同分布采样下,A3C 达到 ϵ\epsilon 精度所需的每工作者样本复杂度为 O(ϵ2.5/N)\mathcal{O}(\epsilon^{-2.5}/N),其中 NN 为工作者数量。与已知最优的双时间尺度 AC 的样本复杂度 O(ϵ2.5)\mathcal{O}(\epsilon^{-2.5}) 相比,A3C 实现了线性加速,这首次从理论上证明了 AC 算法中并行与异步的优势。我们在合成环境、OpenAI Gym 环境和 Atari 游戏上提供了数值测试以验证我们的理论分析。

关键词

引用

@article{arxiv.2012.15511,
  title  = {Towards Understanding Asynchronous Advantage Actor-critic: Convergence and Linear Speedup},
  author = {Han Shen and Kaiqing Zhang and Mingyi Hong and Tianyi Chen},
  journal= {arXiv preprint arXiv:2012.15511},
  year   = {2023}
}