中文

面向在线持续预测的元下降方法

机器学习 2019-12-16 v2 机器学习

摘要

本文研究了针对非平稳在线持续预测问题的不同向量步长自适应方法。通过用适当选择的步长向量缩放更新,可以显著改进朴素随机梯度下降。许多方法,包括 AdaGrad、RMSProp 和 AMSGrad,保留关于学习过程的统计信息以近似二阶更新——即逆海森矩阵的一种向量近似。另一类方法使用元梯度下降来适应步长参数以最小化预测误差。这些元下降策略在非平稳问题中很有前景,但尚未像准二阶方法那样被广泛探索。我们首先推导了一个通用的增量元下降算法,称为 AdaGain,旨在适用于更广泛的算法,包括具有半梯度更新的算法甚至具有加速的算法,如 RMSProp。我们提供了来自两个家族的方法的经验比较。我们得出结论,两个家族的方法都可以表现良好,但在非平稳预测问题中元下降方法表现出优势。我们的方法在多个预测问题上特别鲁棒,并且在来自移动机器人的真实数据的大规模时间序列预测问题上与最先进的方法具有竞争力。

关键词

引用

@article{arxiv.1907.07751,
  title  = {Meta-descent for Online, Continual Prediction},
  author = {Andrew Jacobsen and Matthew Schlegel and Cameron Linke and Thomas Degris and Adam White and Martha White},
  journal= {arXiv preprint arXiv:1907.07751},
  year   = {2019}
}

备注

AAAI Conference on Artificial Intelligence 2019. v2: Correction to Baird's counterexample. A bug in the code lead to results being reported for AMSGrad in this experiment, when they were actually results for Adam