中文

过参数化浅层神经网络用于监督学习的基本极限

机器学习 2023-07-13 v1 无序系统与神经网络 统计力学 信息论 math.IT 统计理论 统计理论

摘要

我们对一个两层神经网络进行信息论分析,该网络从由具有相同架构的教师网络生成的输入输出对中训练,处于过参数化 regime。我们的结果以界限的形式给出,将 i) 训练数据与网络权重之间的互信息,或 ii) 贝叶斯最优泛化误差,与对应一个更简单的(广义)线性模型的相同量相关联,而后者已有严格已知的显式表达式。我们的界限用训练样本数、输入维度和隐藏单元数表示,从而对任意神经网络(实际上是任何学习过程)在由我们的两层教师神经网络模型生成的有限数据上训练给出了基本性能极限。证明依赖于来自自旋玻璃的严格工具,并受作为近期众多神经网络分析核心的“高斯等价原理”指导。相较于现有文献(非严格或仅限于只读出权重的情形),我们的结果是信息论的(即不特定于任何学习算法),且重要的是,涵盖了所有网络参数均被训练的设置。

关键词

引用

@article{arxiv.2307.05635,
  title  = {Fundamental limits of overparametrized shallow neural networks for supervised learning},
  author = {Francesco Camilli and Daria Tieplova and Jean Barbier},
  journal= {arXiv preprint arXiv:2307.05635},
  year   = {2023}
}

备注

30 pages, 1 figure