基于经验方差最小化的策略梯度方法方差缩减
机器学习
2022-06-16 v2
摘要
强化学习(RL)中的策略梯度方法非常通用且广泛应用于实践,但其性能受梯度估计高方差的影响。已提出若干程序以降低方差,包括 actor-critic(AC)与优势 actor-critic(A2C)方法。近来由于深度 RL 的引入,这些方法获得新视角:在神经网络等复杂模型设定下,新的控制变量(CV)与新的子采样程序均成为可能。基于 CV 方法的关键部分在于 CV 训练的目标泛函,最流行的是 A2C 的最小二乘准则。尽管其取得实际成功,该准则并非唯一可能。本文首次研究称为经验方差(EV)的准则之性能。我们在实验中观察到 EV 准则不仅表现不逊于 A2C,有时还可显著更优。此外,我们在非常一般的假设下证明了实际方差缩减的若干理论保证,并表明 A2C 最小二乘目标泛函是 EV 目标的上界。我们的实验表明,在方差缩减方面基于 EV 的方法远优于 A2C,并可实现更强的方差缩减。
引用
@article{arxiv.2206.06827,
title = {Variance Reduction for Policy-Gradient Methods via Empirical Variance Minimization},
author = {Maxim Kaledin and Alexander Golubev and Denis Belomestny},
journal= {arXiv preprint arXiv:2206.06827},
year = {2022}
}