中文

AdaLoss:一种计算高效且可证明收敛的自适应梯度方法

机器学习 2021-09-20 v1 机器学习

摘要

我们提出一种计算友好的自适应学习率调度“AdaLoss”,它直接利用损失函数的信息来调整梯度下降方法中的步长。我们证明该调度在线性回归中享有线性收敛。此外,我们在非凸情形下针对两层过参数化神经网络给出线性收敛保证。若两层网络第一隐藏层的宽度足够大(多项式级),则 AdaLoss 在多项式时间内鲁棒地收敛到全局最小。我们通过数值实验验证了理论结果,并考虑文本澄清的 LSTM 模型与控制问题的策略梯度应用,扩展了数值实验的范围。

关键词

引用

@article{arxiv.2109.08282,
  title  = {AdaLoss: A computationally-efficient and provably convergent adaptive gradient method},
  author = {Xiaoxia Wu and Yuege Xie and Simon Du and Rachel Ward},
  journal= {arXiv preprint arXiv:2109.08282},
  year   = {2021}
}

备注

arXiv admin note: text overlap with arXiv:1902.07111