中文

显化两层神经网络中频率原理的隐式偏置

机器学习 2019-05-27 v1 机器学习

摘要

深度神经网络(DNNs)参数多于样本却常能良好泛化,这仍是一个谜。理解此谜的一种尝试是发现 DNN 训练过程底层的隐式偏置,例如频率原理(F-Principle),即 DNN 常从低频到高频拟合目标函数。受 F-Principle 启发,我们提出线性频率原理(LFP)动力学的有效模型,其精确预测大宽度两层 ReLU 神经网络(NNs)的学习结果。该 LFP 动力学由 NN 的线性化平均场残差动力学所合理化。重要的是,此 LFP 动力学的长时间极限解等价于一个显式最小化 FP-范数的约束优化问题的解,其中可行解的高频受到更重惩罚。利用该优化公式,我们给出了泛化误差界的一个先验估计,揭示目标函数的更高 FP-范数会增大泛化误差。总体而言,通过将 F-Principle 的隐式偏置显化为两层 NN 的显式惩罚,我们的工作朝定量理解一般 DNN 的学习与泛化迈出了一步。

关键词

引用

@article{arxiv.1905.10264,
  title  = {Explicitizing an Implicit Bias of the Frequency Principle in Two-layer Neural Networks},
  author = {Yaoyu Zhang and Zhi-Qin John Xu and Tao Luo and Zheng Ma},
  journal= {arXiv preprint arXiv:1905.10264},
  year   = {2019}
}