中文

线性频率原理动力学的精确计算及其泛化

机器学习 2020-10-19 v1

摘要

近期工作展示了深度神经网络(DNNs)训练过程中从低频到高频拟合目标函数的频率原理(F-Principle)这一有趣现象,为复杂任务中 DNN 的训练与泛化行为提供了洞见。本文通过分析神经正切核(NTK)机制下无限宽两层 NN,推导了训练过程中频域中 NN 输出函数演化的精确微分方程,即线性频率原理(LFP)模型。我们的精确计算适用于一般激活函数,且不对训练数据的大小与分布作假设。该 LFP 模型揭示了高频比低频演化得慢多项式级或指数级,取决于激活函数的光滑性/正则性。我们通过证明 LFP 模型隐式最小化所学函数的频率原理范数(FP-norm)进一步弥合了训练动力学与泛化之间的鸿沟,由此高频根据其演化速率的倒数受到更严重的惩罚。最后,我们推导了由目标函数的 FP-norm 控制的先验泛化误差界,为 DNN 常对低频函数泛化良好的经验结果提供了理论依据。

关键词

引用

@article{arxiv.2010.08153,
  title  = {On the exact computation of linear frequency principle dynamics and its generalization},
  author = {Tao Luo and Zheng Ma and Zhi-Qin John Xu and Yaoyu Zhang},
  journal= {arXiv preprint arXiv:2010.08153},
  year   = {2020}
}

备注

Authors are listed alphabetically. arXiv admin note: substantial text overlap with arXiv:1905.10264