用于策略梯度方法方差缩减的轨迹级控制变量
机器学习
2019-08-12 v1 机器学习
摘要
策略梯度方法在具有高维连续状态与动作空间的强化学习任务中已展现出成功。然而,策略梯度方法也以样本效率低而著称。这至少部分可归因于使用蒙特卡洛方法估计任务目标梯度时的高方差。先前的研究致力于通过研究控制变量(CVs)来应对该问题,这类控制变量可在不引入偏差的情况下降低估计方差,包括基线的早期使用、状态相关 CVs,以及较新的状态-动作相关 CVs。在本工作中,我们分析了先前 CV 技术的性质与缺陷,并出人意料地发现,这些工作忽略了一个重要事实:蒙特卡洛梯度估计是由状态与动作的轨迹生成的。我们表明,忽略轨迹间的相关性会导致次优的方差缩减,并提出一个简单的修正:一类“轨迹级”CVs,可进一步压低方差。我们表明,构建轨迹级 CVs 可递归完成,且仅需像先前策略梯度 CVs 那样学习状态-动作值函数。我们进一步证明,在合理假设下,所提轨迹级 CVs 对于方差缩减是最优的。
引用
@article{arxiv.1908.03263,
title = {Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods},
author = {Ching-An Cheng and Xinyan Yan and Byron Boots},
journal= {arXiv preprint arXiv:1908.03263},
year = {2019}
}