中文

变分约束深度神经网络的收敛速率

机器学习 2022-06-28 v2 信号处理 机器学习

摘要

多层前馈网络已被用于逼近广泛的非线性函数。一个重要且基本的问题是透过其统计风险(即对未来的期望预测误差)理解网络模型的可学习性。据我们所知,现有工作所展示的神经网络收敛速率对于样本量 nn 至多被 n1/4n^{-1/4} 阶所限制。在本文中,我们证明一类任意宽度的变分约束神经网络能够以任意小的正常数 δ\delta 达到近参数速率 n1/2+δn^{-1/2+\delta}。在均方误差下这等价于 n1+2δn^{-1 +2\delta}。该速率也被数值实验所观测到。结果表明,用于逼近光滑函数的神经函数空间可能并不像通常认为的那么大。我们的结果也为深度神经网络在神经元和学习参数数量随 nn 快速增长甚至超过 nn 时不易过拟合的现象提供了见解。我们还讨论了关于其他网络参数(包括输入维度、网络层数和系数范数)的收敛速率。

关键词

引用

@article{arxiv.2106.12068,
  title  = {The Rate of Convergence of Variation-Constrained Deep Neural Networks},
  author = {Gen Li and Jie Ding},
  journal= {arXiv preprint arXiv:2106.12068},
  year   = {2022}
}