通过插值训练神经网络及用于插值训练
机器学习
2020-08-04 v2 机器学习
摘要
在现代监督学习中,许多深度神经网络能够插值数据:经验损失可以在所有样本上同时被驱动至接近零。在这项工作中,我们显式地利用这一插值性质来设计一种用于深度学习的新优化算法,称之为用于梯度插值的自适应学习率算法(ALI-G)。ALI-G保留了随机梯度下降(SGD)的两个主要优点,即(i)每次迭代的低计算成本和(ii)实践中良好的泛化性能。在每次迭代中,ALI-G利用插值性质以闭式计算自适应学习率。此外,ALI-G将学习率裁剪至最大值,我们证明这对非凸问题有帮助。关键的是,与SGD的学习率不同,ALI-G的最大学习率不需要衰减调度,这使其调参明显更容易。我们在各种随机设定下提供了ALI-G的收敛保证。值得注意的是,我们处理了插值性质在某种容差内满足的现实情况。我们在多种架构和任务上提供了实验:(i)学习一个可微分神经计算机;(ii)在SVHN数据集上训练宽残差网络;(iii)在SNLI数据集上训练Bi-LSTM;以及(iv)在CIFAR数据集上训练宽残差网络和密集连接网络。ALI-G在自适应方法中产生了最先进的结果,甚至取得了与需要手动调优学习率调度的SGD相当的性能。此外,ALI-G在任何标准深度学习框架中易于实现,并可用作现有代码中的直接替换。
引用
@article{arxiv.1906.05661,
title = {Training Neural Networks for and by Interpolation},
author = {Leonard Berrada and Andrew Zisserman and M. Pawan Kumar},
journal= {arXiv preprint arXiv:1906.05661},
year = {2020}
}
备注
Published at ICML 2020