迈向理解异步优势 actor-critic:收敛性与线性加速
机器学习
2023-08-02 v2 最优化与控制
摘要
标准强化学习(RL)算法的异步与并行实现是现代 RL 巨大成功的关键推动因素。在众多异步 RL 算法中,可以说最流行且最有效的是异步优势 actor-critic(A3C)算法。尽管 A3C 正成为 RL 的主力,其理论性质仍未被充分理解,包括其非渐近分析以及并行带来的性能提升(即线性加速)。本文重新审视 A3C 算法并建立其非渐近收敛保证。在独立同分布和马尔可夫采样下,我们分别建立了 A3C 在一般策略近似情形下的局部收敛保证,以及在 softmax 策略参数化下的全局收敛保证。在独立同分布采样下,A3C 达到 精度所需的每工作者样本复杂度为 ,其中 为工作者数量。与已知最优的双时间尺度 AC 的样本复杂度 相比,A3C 实现了线性加速,这首次从理论上证明了 AC 算法中并行与异步的优势。我们在合成环境、OpenAI Gym 环境和 Atari 游戏上提供了数值测试以验证我们的理论分析。
引用
@article{arxiv.2012.15511,
title = {Towards Understanding Asynchronous Advantage Actor-critic: Convergence and Linear Speedup},
author = {Han Shen and Kaiqing Zhang and Mingyi Hong and Tianyi Chen},
journal= {arXiv preprint arXiv:2012.15511},
year = {2023}
}