中文

深度嵌入原理:深度神经网络损失景观分析

机器学习 2025-04-15 v4

摘要

理解深层与浅层神经网络之间的关系对深度学习的理论研究极为重要。本工作中,我们发现一种深度上的嵌入原理:一个神经网络的损失景观“包含”所有更浅神经网络损失景观的临界点。我们这一发现的关键工具是本文提出的临界提升算子,它将任意网络的临界点映射到任意更深网络的临界流形,同时保持输出不变。该原理为深度神经网络的许多广泛观测行为提供了新见解。关于深度网络的易训练性,我们表明神经网络的局部极小可提升为更深网络的严格鞍点。关于批归一化的加速效应,我们证明批归一化通过抑制层线性化来帮助避免从更浅神经网络提升而来的临界流形。我们还证明增加训练数据会收缩被提升的临界流形,正如实验所展示的,这可导致训练加速。总体而言,我们发现的深度嵌入原理揭示了深度学习损失景观的深度分层结构,为进一步研究深度对深度神经网络的作用奠定了坚实基础。

关键词

引用

@article{arxiv.2205.13283,
  title  = {Embedding Principle in Depth for the Loss Landscape Analysis of Deep Neural Networks},
  author = {Zhiwei Bai and Tao Luo and Zhi-Qin John Xu and Yaoyu Zhang},
  journal= {arXiv preprint arXiv:2205.13283},
  year   = {2025}
}