中文

改进(自然) actor-critic 算法的样本复杂度界

机器学习 2021-02-15 v4 机器学习

摘要

actor-critic (AC) 算法是强化学习中寻找最优策略的一种流行方法。在无限 horizon 场景下,AC 和自然 actor-critic (NAC) 算法的有限样本收敛速率近来已被建立,但均基于独立同分布 (i.i.d.) 采样以及每次迭代单样本更新。相比之下,本文刻画了在马尔可夫采样、每次迭代使用 mini-batch 数据、且 actor 具有一般策略类近似下的 AC 和 NAC 的收敛速率与样本复杂度。我们表明,mini-batch AC 达到 ϵ\epsilon-精度驻点所需的总体样本复杂度比已知最好的 AC 样本复杂度改进了 O(ϵ1log(1/ϵ))\mathcal{O}(\epsilon^{-1}\log(1/\epsilon)) 个数量级,而 mini-batch NAC 达到 ϵ\epsilon-精度全局最优点所需的总体样本复杂度比现有 NAC 样本复杂度改进了 O(ϵ1/log(1/ϵ))\mathcal{O}(\epsilon^{-1}/\log(1/\epsilon)) 个数量级。此外,本文刻画的 AC 和 NAC 的样本复杂度分别优于策略梯度 (PG) 和自然策略梯度 (NPG) 达 O((1γ)3)\mathcal{O}((1-\gamma)^{-3})O((1γ)4ϵ1/log(1/ϵ))\mathcal{O}((1-\gamma)^{-4}\epsilon^{-1}/\log(1/\epsilon)) 倍。这是首个理论研究表明,由于引入了 critic,AC 和 NAC 在无限 horizon 下相较 PG 和 NPG 取得了阶数上的性能提升。

关键词

引用

@article{arxiv.2004.12956,
  title  = {Improving Sample Complexity Bounds for (Natural) Actor-Critic Algorithms},
  author = {Tengyu Xu and Zhe Wang and Yingbin Liang},
  journal= {arXiv preprint arXiv:2004.12956},
  year   = {2021}
}

备注

Accepted by NeurIPS 2020