多层前瞻:前瞻的一种嵌套版本
机器学习
2021-10-28 v1 计算机视觉与模式识别
摘要
近年来,SGD及其变体已成为训练深度神经网络的标准工具。在本文中,我们关注于最近提出的变体Lookahead,它在广泛应用中优于SGD。继这一成功之后,我们研究了该算法的扩展——多层前瞻(Multilayer Lookahead)优化器,它递归地将Lookahead包裹自身。我们证明了两层多层前瞻对光滑非凸函数收敛到驻点,速率为O(1/√T)。我们还通过展示它们如何放大SGD的隐式正则化效应,论证了Lookahead相对于SGD以及多层前瞻相对于Lookahead的改进泛化能力。我们通过实验验证了我们的结果,并表明多层前瞻在CIFAR-10和CIFAR-100分类任务以及MNIST数据集上的GANs训练中优于Lookahead。
引用
@article{arxiv.2110.14254,
title = {Multilayer Lookahead: a Nested Version of Lookahead},
author = {Denys Pushkin and Luis Barba},
journal= {arXiv preprint arXiv:2110.14254},
year = {2021}
}