中文

深度残差神经网络相比浅层网络导出的更小泛化误差

数值分析 2021-04-15 v2 数值分析 最优化与控制

摘要

我们证明了一个具有 LL 个随机傅里叶特征层 zˉ+1=zˉ+Rek=1Kbˉkeiωkzˉ+Rek=1Kcˉkeiωkx\bar z_{\ell+1}=\bar z_\ell + \mathrm{Re}\sum_{k=1}^K\bar b_{\ell k}e^{\mathrm{i}\omega_{\ell k}\bar z_\ell}+ \mathrm{Re}\sum_{k=1}^K\bar c_{\ell k}e^{\mathrm{i}\omega'_{\ell k}\cdot x} 的残差神经网络的泛化误差估计。推导了随机傅里叶特征 eiωkzˉe^{\mathrm{i}\omega_{\ell k}\bar z_\ell}eiωkxe^{\mathrm{i}\omega'_{\ell k}\cdot x} 的频率 (ωk,ωk)(\omega_{\ell k},\omega'_{\ell k}) 的最优分布。该推导基于函数 values f(x)f(x) 近似的相应泛化误差。结果表明,在 ffLL^\infty 范数远小于其傅里叶变换 f^\hat fL1L^1 范数的情况下,该泛化误差小于具有一个隐藏层且相同总节点数 KLKL 的随机傅里叶特征的泛化误差估计 f^L1(Rd)2/(KL){\|\hat f\|^2_{L^1(\mathbb{R}^d)}}/{(KL)}。这种对随机特征最优分布的理解被用于构造一种深度残差网络的新训练方法。所提出新算法的良好性能在计算实验中得到了展示。

关键词

引用

@article{arxiv.2010.01887,
  title  = {Smaller generalization error derived for a deep residual neural network compared to shallow networks},
  author = {Aku Kammonen and Jonas Kiessling and Petr Plecháč and Mattias Sandberg and Anders Szepessy and Raúl Tempone},
  journal= {arXiv preprint arXiv:2010.01887},
  year   = {2021}
}