随机初始化表现优于随机猜测及其寻找方法
机器学习
2022-11-08 v2
摘要
从不同的随机初始化开始、使用随机梯度下降(SGD)训练的神经网络通常会找到功能上非常相似的解,这引发了关于不同 SGD 解之间是否存在有意义差异的问题。Entezari 等人最近猜想,尽管初始化不同,但 SGD 找到的解在考虑神经网络的置换不变性后位于同一损失谷中。具体而言,他们假设 SGD 找到的任意两个解可以被置换,使得它们参数之间的线性插值在损失上不会出现显著上升。在此,我们使用一种简单但强大的算法来寻找此类置换,从而能够获得直接经验证据,证明该假设在全连接网络中成立。引人注目的是,我们发现两个网络在初始化时就已经处于同一损失谷中,并且对它们随机但经过适当置换的初始化进行平均,其表现显著优于随机猜测。相比之下,对于卷积架构,我们的证据表明该假设不成立。尤其是在大学习率 regime 下,SGD 似乎发现了多样化的模式。
引用
@article{arxiv.2209.07509,
title = {Random initialisations performing above chance and how to find them},
author = {Frederik Benzing and Simon Schug and Robert Meier and Johannes von Oswald and Yassir Akram and Nicolas Zucchet and Laurence Aitchison and Angelika Steger},
journal= {arXiv preprint arXiv:2209.07509},
year = {2022}
}
备注
NeurIPS 2022, 14th Annual Workshop on Optimization for Machine Learning (OPT2022)