中文

深度神经网络密集层连通性的数学建模与收敛分析

机器学习 2025-10-03 v1

摘要

在深度学习中,密集层连通性已成为深度神经网络 (DNN) 设计中的关键原则,能够高效实现信息传递,并在广泛的应用范围内展现出强性能。在本工作中,我们对密集连接的 DNN 进行数学建模,并从深层极限视角分析其学习问题。为确保广泛适用性,我们在包含密集连接层和一般非本地特征变换(以局部特征变换为特例)的框架内进行分析,这种称为密集非本地 (DNL) 框架的设定包含标准 DenseNet 及其变体作为特例。在该表述下,密集连接网络被建模为非线性积分方程,与先前研究中常采用的常微分方程观点不同。我们从最优控制视角研究相关训练问题,并证明从网络学习问题收敛到其连续时间对应问题。特别地,我们使用分段线性延拓和 Γ\Gamma-收敛分析,证明最优值的收敛性以及最小化器的子列收敛。我们的结果为理解密集连接的 DNN 提供了数学基础,并进一步表明此类架构可以为训练深层模型提供稳定性。

关键词

引用

@article{arxiv.2510.02049,
  title  = {Mathematical Modeling and Convergence Analysis of Deep Neural Networks with Dense Layer Connectivities in Deep Learning},
  author = {Jinshu Huang and Haibin Su and Xue-Cheng Tai and Chunlin Wu},
  journal= {arXiv preprint arXiv:2510.02049},
  year   = {2025}
}