神经网络梯度下降训练中的普适标度律
机器学习
2021-05-04 v1 神经与进化计算
最优化与控制
机器学习
摘要
当前关于梯度下降训练的神经网络优化轨迹的理论结果通常表现为对损失值的严格但可能宽松的界。在本工作中,我们采取不同方法,表明学习轨迹可由大训练时间下的显式渐近行为刻画。具体而言,损失渐近展开中的主导项表现为幂律 ,其中指数 仅由数据维度、激活函数的光滑性以及所逼近的函数类表达。我们的结果基于对表示在期望损失上训练的大网络线性化演化的积分算子的谱分析。重要的是,我们所采用的技术不要求数据分布的特定形式(例如高斯分布),从而使我们的发现具有充分的普适性。
引用
@article{arxiv.2105.00507,
title = {Universal scaling laws in the gradient descent training of neural networks},
author = {Maksim Velikanov and Dmitry Yarotsky},
journal= {arXiv preprint arXiv:2105.00507},
year = {2021}
}