神经网络训练的早期阶段
机器学习
2020-02-25 v1 神经与进化计算
机器学习
摘要
近期研究表明,神经网络学习的许多重要方面发生在训练的最早几次迭代或轮次内。例如,稀疏可训练子网络浮现(Frankle 等,2019),梯度下降进入一个小子空间(Gur-Ari 等,2018),以及网络经历一个临界期(Achille 等,2019)。在此,我们考察深度神经网络在训练早期阶段所发生的变化。我们在这些早期迭代中对网络状态进行了大量测量,并利用 Frankle 等(2019)的框架定量探查权重分布及其对数据集各方面的依赖。我们发现,在该框架内,深度网络在保持符号不变而用随机权重重新初始化时并不鲁棒,且即便仅数百次迭代后权重分布也高度不独立。尽管有此行为,使用模糊输入或辅助自监督任务进行预训练可近似监督网络中的变化,表明这些变化并非内在依赖于标签,尽管标签显著加速了该过程。综上,这些结果有助于阐明学习这一关键初始期内发生的网络变化。
引用
@article{arxiv.2002.10365,
title = {The Early Phase of Neural Network Training},
author = {Jonathan Frankle and David J. Schwab and Ari S. Morcos},
journal= {arXiv preprint arXiv:2002.10365},
year = {2020}
}
备注
ICLR 2020 Camera Ready. Available on OpenReview at https://openreview.net/forum?id=Hkl1iRNFwS