中文

深度线性网络中泛化动态与迁移学习的解析理论

机器学习 2019-01-08 v2 机器学习

摘要

近来,深度学习中泛化之谜备受关注:大型深度网络能良好泛化,但现有约束泛化误差的理论却极其宽松,因而无法解释这一惊人表现。此外,一个主要期望是知识可跨任务迁移,从而使多任务学习能改善各任务的泛化。然而我们缺乏能够定量预测知识迁移程度如何依赖于任务间关系的解析理论。我们发展了深度线性网络内及跨任务泛化非线性动态的解析理论。具体而言,我们的理论给出了深度网络的训练与测试误差关于训练时间、样本数、网络规模与初始化、以及任务结构与信噪比(SNR)的解析解。我们的理论揭示,深度网络优先渐进地学习最重要的任务结构,因此在早停时刻的泛化误差主要依赖于任务结构且与网络规模无关。这表明任何紧的泛化误差界都必须考虑任务结构,并解释了关于真实数据比随机数据学得更快的观察。有趣的是,我们的理论还揭示了一种可证明优于通过梯度下降训练神经网络的算法。最后,对于迁移学习,我们的理论揭示知识迁移敏感但可计算地依赖于成对任务的 SNR 与输入特征对齐。

关键词

引用

@article{arxiv.1809.10374,
  title  = {An analytic theory of generalization dynamics and transfer learning in deep linear networks},
  author = {Andrew K. Lampinen and Surya Ganguli},
  journal= {arXiv preprint arXiv:1809.10374},
  year   = {2019}
}

备注

ICLR 2019, 20 pages