中文

面向神经网络的最优层次训练

数值分析 2024-10-31 v2 数值分析

摘要

我们提出了一种用于标准前馈神经网络的层次训练算法,该算法在优化达到 stationary point 时会自适应扩展网络架构。通过求解小型(低维)优化问题,扩展后的网络可证明地跳出任何局部最小值或 stationary point。在数据可被稳定神经网络逼近的某些假设下,我们证明该算法以 optimal 收敛率收敛,即损失函数受参数数量的 s-s 次方的上界。作为副产品,我们获得了可计算的指标,用于判断给定网络训练状态的最优性,并推导出一种新的泛化误差概念。

关键词

引用

@article{arxiv.2407.02242,
  title  = {Towards optimal hierarchical training of neural networks},
  author = {Michael Feischl and Alexander Rieder and Fabian Zehetgruber},
  journal= {arXiv preprint arXiv:2407.02242},
  year   = {2024}
}