面向深度策略梯度的坐标wise控制变量
机器学习
2021-08-12 v2
摘要
控制变量(CV)方法被广泛用于策略梯度估计,以在实践中降低梯度估计器的方差。控制变量的应用方式是从状态-动作价值估计中减去一个基线函数。随后方差降低的策略梯度有望带来更高的学习效率。近期关于深度神经网络策略控制变量的研究主要关注标量值基线函数,而向量值基线的影响尚未得到充分探索。本文研究了利用由向量值基线构造的坐标wise和层wise控制变量对神经网络策略进行方差降低的方法。我们给出的实验证据表明,此类基线可比传统标量值基线获得更低的方差。我们展示了如何使流行的近端策略优化(PPO)算法配备这些新控制变量。我们表明,所得算法在适当正则化后,在连续控制基准中可比标量控制变量实现更高的样本效率。
引用
@article{arxiv.2107.04987,
title = {Coordinate-wise Control Variates for Deep Policy Gradients},
author = {Yuanyi Zhong and Yuan Zhou and Jian Peng},
journal= {arXiv preprint arXiv:2107.04987},
year = {2021}
}
备注
14 pages, 3 figures, added references compared to v1