中文

深度学习数学原理研究

机器学习 2021-04-30 v1 最优化与控制 应用统计 机器学习

摘要

“深度学习”/“深度神经网络”是一项技术奇迹,如今正日益部署于人工智能前沿任务。近年来深度学习的巨大成功依赖于大量启发式方法,而能够严格解释这些方法已成为严峻的数学挑战。本提交至约翰霍普金斯大学应用数学与统计系的论文,朝为这些深度学习新范式建立坚实理论基础迈进数步。第2章中,我们给出深度神经函数的新型电路复杂度定理,并证明关于这些函数空间的分类定理,进而导出深度2 ReLU网络经验风险最小化的精确算法。我们还提出神经函数复杂度的度量以构造性地确立高复杂度神经函数的存在。第3章给出首个可在可实现设定下以近分布无关 setup 中线性时间训练ReLU门的算法。第4章给出用于解释自编码器能够进行稀疏编码现象 rigorous 证明。第5章给出广泛使用的自适应梯度深度学习算法RMSProp与ADAM的随机与确定性版本收敛性的首创证明。该章还包含关于自编码器超参数取值的详细实证研究,揭示现代算法相较经典基于加速的方法具显著优势之处。末章第6章给出随机神经网络风险的新型改进PAC-Bayesian界。该章还包含实验研究,揭示训练期间网络在权重空间所追踪路径的新几何性质。

关键词

引用

@article{arxiv.2104.14033,
  title  = {A Study of the Mathematics of Deep Learning},
  author = {Anirbit Mukherjee},
  journal= {arXiv preprint arXiv:2104.14033},
  year   = {2021}
}

备注

(A) Our PAC-Bayes risk bounds on neural nets given in Section 6 here does not yet occur in any other file on arXiv. (B) In our paper arXiv:/2005.04211, there is a significantly improved version of Section 3.3 of this thesis