深度残差网络梯度下降的收敛性与隐式正则化性质
机器学习
2023-01-26 v4 最优化与控制
摘要
我们证明了对于层宽恒定且激活函数光滑的深度残差网络训练,梯度下降线性收敛至全局最优。我们表明,若训练所得权重作为层索引的函数在深度增加时承认缩放极限,则该极限具有有限的 变差且 。证明基于对损失函数及梯度下降路径上网络权重范数的非渐近估计。我们使用有监督学习问题上的详细数值实验说明了我们的理论结果与实际设置的相关性。
引用
@article{arxiv.2204.07261,
title = {Convergence and Implicit Regularization Properties of Gradient Descent for Deep Residual Networks},
author = {Rama Cont and Alain Rossier and RenYuan Xu},
journal= {arXiv preprint arXiv:2204.07261},
year = {2023}
}