通过Polyak动量实现可证明加速的模块化分析:训练宽ReLU网络与深度线性网络
机器学习
2021-06-14 v6 最优化与控制
机器学习
摘要
在梯度下降方法中引入所谓的“动量”动态被广泛用于神经网络训练,因为已广泛观察到它至少在经验上常带来显著更快的收敛。与此同时,文献中极少有理论保证来解释这种明显的加速效应。即便对于经典强凸二次问题,若干现有结果仅表明Polyak动量具有渐近加速的线性速率。本文中,我们首先重访二次问题并给出Polyak动量的非渐近加速线性速率。随后,我们可证明地表明,Polyak动量在训练单层宽ReLU网络与深度线性网络时实现了加速,这两者或许是文献中研究优化与深度学习最常用的两个典型模型。先前工作Du et al. 2019与Wu et al. 2019表明,使用朴素梯度下降并借助过参数化,经过t次迭代后误差以衰减,其中为Gram矩阵的条件数。我们的结果表明,在适当选取参数下,Polyak动量具有的速率。对于深度线性网络,先前工作Hu et al. 2020表明朴素梯度下降具有的速率,其中为数据矩阵的条件数。我们的结果表明,Polyak动量可实现的加速速率。本工作所有结果均源自模块化分析,其本身具独立意义。本工作确立了动量确实能加速神经网络训练。
引用
@article{arxiv.2010.01618,
title = {A Modular Analysis of Provable Acceleration via Polyak's Momentum: Training a Wide ReLU Network and a Deep Linear Network},
author = {Jun-Kun Wang and Chi-Heng Lin and Jacob Abernethy},
journal= {arXiv preprint arXiv:2010.01618},
year = {2021}
}
备注
Accepted at ICML 2021