中文

包含神经网络的高维岭函数组合的风险界

统计理论 2018-10-31 v4 机器学习 统计理论

摘要

ff^{\star}Rd\mathbb{R}^d 上的一个函数,并假设其谱范数为 vfv_{f^{\star}}。对于各种噪声设定,我们证明 Ef^f2(vf4logdn)1/3\mathbb{E}\|\hat{f} - f^{\star} \|^2 \leq \left(v^4_{f^{\star}}\frac{\log d}{n}\right)^{1/3},其中 nn 为样本量,f^\hat{f} 为惩罚最小二乘估计量或通过贪婪方式获得的此类估计量,使用正弦、S 形、斜坡、斜坡平方或其他光滑岭函数的线性组合。候选拟合可从函数的连续统中选择,从而避免了参数空间离散化的刚性。另一方面,若候选拟合从离散化中选择,我们证明 Ef^f2(vf3logdn)2/5\mathbb{E}\|\hat{f} - f^{\star} \|^2 \leq \left(v^3_{f^{\star}}\frac{\log d}{n}\right)^{2/5}。这项工作连接了非线性与非参数函数估计,并包含单隐层网络。与以往针对此类设定的理论不同,我们的界表明,即使无限维参数化字典的输入维度 dd 远大于可用样本量,风险依然很小。当维度大于样本量的立方根时,该量被证明优于更常见的风险界 vf(dlog(n/d)n)1/2v_{f^{\star}}\left(\frac{d\log (n/d)}{n}\right)^{1/2},后者也在本文中进行了探讨。

关键词

引用

@article{arxiv.1607.01434,
  title  = {Risk Bounds for High-dimensional Ridge Function Combinations Including Neural Networks},
  author = {Jason M. Klusowski and Andrew R. Barron},
  journal= {arXiv preprint arXiv:1607.01434},
  year   = {2018}
}

备注

Submitted to Annals of Statistics