中文

Expectigrad:具有鲁棒收敛性质的快速随机优化方法

机器学习 2021-10-13 v2 机器学习

摘要

许多流行的自适应梯度方法(如 Adam 和 RMSProp)依赖指数移动平均(EMA)来归一化其步长。尽管 EMA 使这些方法对新梯度信息高度敏感,近期研究表明它至少在一个凸优化问题上会导致发散。我们提出一种称为 Expectigrad 的新方法,其根据各分量所有历史梯度的非加权均值调整步长,并在分子与分母间联合计算偏差校正动量项。我们证明 Expectigrad 在已知会导致 Adam 发散的该优化问题的每个实例上均不会发散。我们还在一般随机非凸设定下建立了遗憾界,表明 Expectigrad 比现有方法更不易受梯度方差影响。在多个高维机器学习任务上测试 Expectigrad,我们发现其常以极少的超参数调优优于最先进的方法。

关键词

引用

@article{arxiv.2010.01356,
  title  = {Expectigrad: Fast Stochastic Optimization with Robust Convergence Properties},
  author = {Brett Daley and Christopher Amato},
  journal= {arXiv preprint arXiv:2010.01356},
  year   = {2021}
}

备注

Preprint. 18 pages, 4 figures, 3 tables