中文

在无限宽度极限下训练深度神经网络的可积参数化

机器学习 2021-12-21 v2

摘要

为从理论理解训练后深度神经网络的行为,有必要研究从随机初始化出发由梯度方法诱导的动力学。然而,这些模型的非线性与组合结构使这些动力学难以分析。为克服这些挑战,大宽度渐近近期已成为富有成果的视角,并为真实世界深度网络提供了实用见解。对于两层神经网络,通过这些渐近已认识到训练模型的性质随初始随机权重的尺度发生根本改变,从核机制(大初始方差)到特征学习机制(小初始方差)不等。对于更深网络可能存在更多机制,本文详细研究对应于神经网络“平均场”极限的一类特定“小”初始化选择,称之为可积参数化(IPs)。首先,我们证明在标准 i.i.d. 零均值初始化下,层数超过四的可积参数化神经网络在无限宽度极限始于驻点,不发生学习。我们随后提出多种避免此平凡行为的方法并详细分析所得动力学。特别地,其中一种方法使用大初始学习率,我们证明其等价于对近期提出的最大更新参数化 μ\muP 的修正。我们通过图像分类任务的数值实验确认了结果,实验还显示出不同激活函数选择间行为的强烈差异,而理论尚未捕捉此差异。

关键词

引用

@article{arxiv.2110.15596,
  title  = {Training Integrable Parameterizations of Deep Neural Networks in the Infinite-Width Limit},
  author = {Karl Hajjar and Lénaïc Chizat and Christophe Giraud},
  journal= {arXiv preprint arXiv:2110.15596},
  year   = {2021}
}