改进(自然) actor-critic 算法的样本复杂度界
机器学习
2021-02-15 v4 机器学习
摘要
actor-critic (AC) 算法是强化学习中寻找最优策略的一种流行方法。在无限 horizon 场景下,AC 和自然 actor-critic (NAC) 算法的有限样本收敛速率近来已被建立,但均基于独立同分布 (i.i.d.) 采样以及每次迭代单样本更新。相比之下,本文刻画了在马尔可夫采样、每次迭代使用 mini-batch 数据、且 actor 具有一般策略类近似下的 AC 和 NAC 的收敛速率与样本复杂度。我们表明,mini-batch AC 达到 -精度驻点所需的总体样本复杂度比已知最好的 AC 样本复杂度改进了 个数量级,而 mini-batch NAC 达到 -精度全局最优点所需的总体样本复杂度比现有 NAC 样本复杂度改进了 个数量级。此外,本文刻画的 AC 和 NAC 的样本复杂度分别优于策略梯度 (PG) 和自然策略梯度 (NPG) 达 和 倍。这是首个理论研究表明,由于引入了 critic,AC 和 NAC 在无限 horizon 下相较 PG 和 NPG 取得了阶数上的性能提升。
引用
@article{arxiv.2004.12956,
title = {Improving Sample Complexity Bounds for (Natural) Actor-Critic Algorithms},
author = {Tengyu Xu and Zhe Wang and Yingbin Liang},
journal= {arXiv preprint arXiv:2004.12956},
year = {2021}
}
备注
Accepted by NeurIPS 2020