中文

关于无偏在线循环优化的方差

机器学习 2019-02-08 v1 机器学习

摘要

近期提出的无偏在线循环优化算法(UORO, arXiv:1702.05043)使用 RTRL 的无偏近似,以在 RNN 中实现完全在线的基于梯度的学习。本文中我们分析 UORO 所计算的梯度估计的方差,并提出对该方法的若干可能改动,其在理论与实践中均降低了该方差。我们还显著增进了对 UORO(及其现有方差缩减技术)的理论与直观理解,并展示了其梯度估计与若在 RNN 隐藏单元中加入少量噪声后由 REINFORCE 将计算的估计之间的根本联系。

关键词

引用

@article{arxiv.1902.02405,
  title  = {On the Variance of Unbiased Online Recurrent Optimization},
  author = {Tim Cooijmans and James Martens},
  journal= {arXiv preprint arXiv:1902.02405},
  year   = {2019}
}