关于梯度下降学习的神经网络回归估计的收敛速度
统计理论
2019-12-10 v1 统计理论
摘要
本文考虑随机设计下的非参数回归。估计量通过在适当选取的单隐藏层神经网络类上最小化带惩罚的经验 风险、并经由梯度下降得到。此处,梯度下降过程以随机选取的权重初值重复多次,并从所构造的估计量列表中选取经验 风险最小者。在随机选取的初值个数与梯度下降步数均足够大的假设下,证明了所得估计量(至多相差一个对数因子)达到了投影寻踪模型中的最优收敛速度。估计量的最终样本量表现通过模拟数据加以说明。
引用
@article{arxiv.1912.03921,
title = {On the rate of convergence of a neural network regression estimate learned by gradient descent},
author = {Alina Braun and Michael Kohler and Harro Walk},
journal= {arXiv preprint arXiv:1912.03921},
year = {2019}
}