深度神经网络在频域中的训练行为
机器学习
2019-11-04 v6 人工智能
信息论
math.IT
统计理论
机器学习
统计理论
摘要
为何能够过拟合的深度神经网络(DNNs)在实践中常具有良好的泛化能力是一个谜 [#zhang2016understanding]。为寻找潜在机制,我们聚焦于研究 DNN 训练过程背后的隐式偏置。本工作中,对真实与合成数据集,我们经验性地发现具有常见设置的 DNN 首先快速捕获主导的低频分量,然后相对缓慢地捕获高频分量。我们称此现象为频率原理(F-Principle)。在我们的实验中,F-Principle 可在各种结构、激活函数和训练算法的 DNN 上观察到。我们也阐释了 F-Principle 如何帮助理解早停的效果以及 DNN 的泛化。该 F-Principle 潜在地为理解 DNN 优化与泛化背后的通用原理提供了见解。
引用
@article{arxiv.1807.01251,
title = {Training behavior of deep neural network in frequency domain},
author = {Zhi-Qin John Xu and Yaoyu Zhang and Yanyang Xiao},
journal= {arXiv preprint arXiv:1807.01251},
year = {2019}
}
备注
To appear in 2019 26th-International conference of neural information processing (ICONIP)