中文

深度神经网络训练的完整误差分析

数值分析 2023-02-10 v2 机器学习 数值分析

摘要

近年来,深度学习算法已非常成功地应用于一系列经典求解范式无法触及的问题。然而,目前尚无完全严格的数学误差与收敛分析来解释深度学习算法的成功。在许多情形下,深度学习算法的误差可分解为三部分:逼近误差、泛化误差与优化误差。本工作中,我们对某深度学习算法的这三部分误差分别进行估计,并将这三个误差估计结合,得到所考虑深度学习算法的整体误差分析。特别地,我们由此确立了该深度学习算法整体误差在合适收敛速度下的收敛性。我们的收敛速度分析远非最优,所确立的收敛速度相当缓慢,随维度指数增长,且尤其受到维数灾难的影响。本工作的主要贡献在于提供一个完整的误差分析:(i) 涵盖深度学习算法中通常出现的三种不同误差来源;(ii) 将这三种误差来源合并为所考虑深度学习算法的单一整体误差估计。

关键词

引用

@article{arxiv.1910.00121,
  title  = {Full error analysis for the training of deep neural networks},
  author = {Christan Beck and Arnulf Jentzen and Benno Kuckuck},
  journal= {arXiv preprint arXiv:1910.00121},
  year   = {2023}
}

备注

53 pages