方差缩减策略梯度方法的收敛性与样本效率研究
机器学习
2021-05-31 v2 机器学习
摘要
策略梯度(PG)衍生出一类丰富的强化学习(RL)方法。近期,出现了利用\emph{方差缩减}技术加速 REINFORCE 等现有 PG 方法的趋势。然而,所有现有方差缩减 PG 方法都严重依赖于对算法每次迭代所做的一项不可检验的重要性权重假设。本文提出一种简单的梯度截断机制以解决该问题。此外,我们设计了截断随机增量方差缩减策略梯度(TSIVR-PG)方法,其能够最大化不仅是奖励的累积和,还包括策略长期访问分布上的通用效用函数。我们给出了 TSIVR-PG 寻找 -平稳策略的 样本复杂度。通过假设策略的过参数化并利用问题的隐式凸性,我们进一步证明 TSIVR-PG 以 样本收敛至全局 -最优策略。
引用
@article{arxiv.2102.08607,
title = {On the Convergence and Sample Efficiency of Variance-Reduced Policy Gradient Method},
author = {Junyu Zhang and Chengzhuo Ni and Zheng Yu and Csaba Szepesvari and Mengdi Wang},
journal= {arXiv preprint arXiv:2102.08607},
year = {2021}
}