Actor Critic 方法中的方差缩减(ACM)
机器学习
2019-07-24 v1 机器学习
摘要
在介绍 Actor Critic 方法(ACM)之后,我们表明 ACM 是控制变量估计量。利用投影定理,我们证明了 Q 与优势 Actor Critic(A2C)方法在由当前状态与动作所条件化的函数张成的控制变量估计量意义下,关于 范数是最优的。这一对勾股定理的直接应用为深度策略梯度方法中常被称为 A2C 方法的 QAC 和 AAC 的强劲表现提供了理论依据。这使我们能够推导出优势 Actor Critic 方法的一种新形式,其具有更低的方差并改进了传统的 A2C 方法。
引用
@article{arxiv.1907.09765,
title = {Variance Reduction in Actor Critic Methods (ACM)},
author = {Eric Benhamou},
journal= {arXiv preprint arXiv:1907.09765},
year = {2019}
}