中文

从二次样本量学习广宽神经网络的贝叶斯最优方法

机器学习 2025-02-10 v1 无序系统与神经网络 信息论 机器学习 math.IT 概率论

摘要

我们考虑学习一个单隐藏层神经网络的目标函数,该网络在第一层后使用二次激活函数且权重为随机变量。我们考虑输入维度与网络宽度成比例增长的渐近极限。近期工作 [Cui & al '23] 证明,当可用样本量仅为维度的线性函数时,线性回归能为学习此类函数提供贝叶斯最优的测试误差。该工作强调了理论上分析样本量为维度二次函数时更有趣的最优测试误差这一开放挑战。在本文中,我们针对二次激活函数解决了这一挑战,并推导了贝叶斯最优测试误差的闭式表达式。我们还提出了一种算法 GAMP-RIE,它将近似消息传递与旋转不变矩阵降噪相结合,并在渐近意义下达到最优性能。技术上,我们的结果得益于与近期关于广泛秩矩阵最优降噪以及椭球拟合问题工作的联系。我们进一步在经验上表明,在无噪声条件下,随机初始化的梯度下降似乎对权重空间进行采样,导致零训练损失,而对初始化进行平均可得到等于贝叶斯最优的测试误差。

关键词

引用

@article{arxiv.2408.03733,
  title  = {Bayes-optimal learning of an extensive-width neural network from quadratically many samples},
  author = {Antoine Maillard and Emanuele Troiani and Simon Martin and Florent Krzakala and Lenka Zdeborová},
  journal= {arXiv preprint arXiv:2408.03733},
  year   = {2025}
}

备注

47 pages