在参数数量相同时更宽的网络是否更好?
机器学习
2021-05-04 v2 机器学习
摘要
经验研究表明,神经网络的性能随参数数量增加而提升。在大多数此类研究中,参数数量通过增加网络宽度来增加。这引出一个问题:观测到的提升是由于更大的参数数量,还是由于更大的宽度本身?我们比较了在保持参数数量不变的情况下增加模型宽度的不同方式。我们表明,对于以随机静态稀疏模式初始化权重张量的模型,只要保证可训练性,网络宽度是良好性能的決定因素,而权重数量则是次要的。作为理解该效应的一步,我们在高斯过程核框架中分析这些模型。我们发现,初始化时稀疏有限宽模型核与无限宽核之间的距离可指示模型性能。
引用
@article{arxiv.2010.14495,
title = {Are wider nets better given the same number of parameters?},
author = {Anna Golubeva and Behnam Neyshabur and Guy Gur-Ari},
journal= {arXiv preprint arXiv:2010.14495},
year = {2021}
}
备注
9 pages