中文

关于梯度下降学习的过参数化深度神经网络估计的普遍一致性

统计理论 2022-08-31 v1 统计理论

摘要

考虑从独立同分布数据估计多元回归函数。定义了一个估计量,它拟合一个由大量全连接神经网络组成的深度神经网络,这些网络通过梯度下降并行计算到数据。该估计量是过参数化的,即其参数数量远大于样本量。结果表明,在合适的网络随机初始化、合适的梯度下降小步长以及梯度下降步数略大于步长的倒数的情况下,该估计量是普遍一致的,即其期望L2误差收敛到零,对于所有响应变量平方可积的数据分布。

关键词

引用

@article{arxiv.2208.14283,
  title  = {On the universal consistency of an over-parametrized deep neural network estimate learned by gradient descent},
  author = {Selina Drews and Michael Kohler},
  journal= {arXiv preprint arXiv:2208.14283},
  year   = {2022}
}