利用过往下降方向改进进化策略中的梯度估计
概率论
2019-10-14 v1 复变函数
统计理论
统计理论
摘要
进化策略(ES)在真实梯度无法计算(如强化学习中)时,已知是针对深度神经网络的一种有效黑盒优化技术。我们延续近期利用替代梯度改进 ES 梯度估计的研究脉络。我们提出一种新颖方法以最优地融入替代梯度信息。与先前工作不同,我们的方法无需关于替代梯度质量的信息,且始终保证找到优于替代梯度的下降方向。这使得可将先前的梯度估计迭代地用作当前搜索点的替代梯度。我们从理论上证明,这会对线性函数产生向真实梯度的快速收敛,并在简化假设下表明其显著改进了一般函数的梯度估计。最后,我们在 MNIST 与强化学习任务上实证评估了我们的方法,显示其在无额外计算成本下显著改进了 ES 的梯度估计。
引用
@article{arxiv.1910.05269,
title = {The density of complex zeros of random sums},
author = {Christopher Corley and Andrew Ledoan},
journal= {arXiv preprint arXiv:1910.05269},
year = {2019}
}
备注
24 pages, 5 figures