中文

非均匀密度输入下神经网络的频率偏置

机器学习 2020-03-11 v1 机器学习

摘要

近期工作将过参数化神经网络的泛化能力部分归因于频率偏置——在均匀分布数据上用梯度下降训练的神经网络会先找到低频拟合再找到高频拟合。由于实际训练集并非从均匀分布中抽取,我们在此使用神经切线核(NTK)模型来探究密度变化对训练动力学的影响。我们结合解析与经验观察的结果表明,当学习频率为 κ\kappa 的纯调和函数时,点 \x\Sphered1\x \in \Sphere^{d-1} 处的收敛发生在时间 O(κd/p(\x))O(\kappa^d/p(\x)) 内,其中 p(\x)p(\x) 表示 \x\x 处的局部密度。具体而言,对于 \Sphere1\Sphere^1 中的数据,我们解析推导了双层网络 NTK 相关核的特征函数。我们进一步针对深层全连接网络给出了关于 NTK 谱分解的收敛结果。我们的实证研究凸显了该模型中深层与浅层网络之间的异同。

关键词

引用

@article{arxiv.2003.04560,
  title  = {Frequency Bias in Neural Networks for Input of Non-Uniform Density},
  author = {Ronen Basri and Meirav Galun and Amnon Geifman and David Jacobs and Yoni Kasten and Shira Kritchman},
  journal= {arXiv preprint arXiv:2003.04560},
  year   = {2020}
}