初始化形状的隐式偏置:超越无穷小镜像下降
机器学习
2021-02-22 v1
摘要
近期的研究强调了初始化尺度在决定梯度方法收敛到的解的结构中的作用。特别地,已表明大初始化导致神经正切核 regime 解,而小初始化导致所谓的“丰富 regime”。然而,初始化结构比整体尺度更丰富,涉及网络中不同权重和层的相对大小。在此我们表明,这些相对尺度(我们称之为初始化形状)在决定所学模型中起着重要作用。我们开发了一种推导梯度流归纳偏置的新技术,并用它来获得多个关注情形的闭式隐式正则化器。
引用
@article{arxiv.2102.09769,
title = {On the Implicit Bias of Initialization Shape: Beyond Infinitesimal Mirror Descent},
author = {Shahar Azulay and Edward Moroshko and Mor Shpigel Nacson and Blake Woodworth and Nathan Srebro and Amir Globerson and Daniel Soudry},
journal= {arXiv preprint arXiv:2102.09769},
year = {2021}
}
备注
33 pages, 2 figures