任意深度的宽神经网络在梯度下降下演化为线性模型
机器学习
2021-02-03 v4 机器学习
摘要
深度学习研究中一个长期的目标是对训练和泛化进行精确刻画。然而,神经网络通常复杂的损失景观使得学习动力学的理论难以建立。在这项工作中,我们证明对于宽神经网络,学习动力学显著简化,并且在无限宽度极限下,它们由网络在其初始参数处一阶泰勒展开得到的线性模型所支配。此外,类比宽贝叶斯神经网络与高斯过程之间的对应关系,采用平方损失的宽神经网络基于梯度的训练所产生的测试集预测,是从具有特定组合核的高斯过程中抽取的。尽管这些理论结果仅在无限宽度极限下严格成立,我们仍发现即便对于有限的实际尺寸网络,原始网络与线性化版本的预测之间也存在极好的经验一致性。这种一致性在不同架构、优化方法和损失函数下都是稳健的。
引用
@article{arxiv.1902.06720,
title = {Wide Neural Networks of Any Depth Evolve as Linear Models Under Gradient Descent},
author = {Jaehoon Lee and Lechao Xiao and Samuel S. Schoenholz and Yasaman Bahri and Roman Novak and Jascha Sohl-Dickstein and Jeffrey Pennington},
journal= {arXiv preprint arXiv:1902.06720},
year = {2021}
}
备注
12+16 pages; open-source code available at https://github.com/google/neural-tangents; accepted to NeurIPS 2019