中文

基于条件最优传输理解无限深宽 ResNet 的训练

机器学习 2025-07-22 v2 最优化与控制

摘要

我们研究了深度神经网络训练中梯度流的收敛性。残差神经网络是非常深的架构示例,但其训练构成一个具有挑战性的优化问题,主要由于目标函数的非凸性和非 coercivity。然而,在实际应用中,这些任务被简单如梯度下降等优化算法成功求解。为更好地理解这一现象,我们关注一种“均场”模型的无限深且任意宽的 ResNet,其由概率测度对层参数组合的集合参数化,并在层集合上保持常数边际。确实,在浅层神经网络的情况下,均场模型在 Wasserstein 度量下训练时表现出简化的损失景观和良好的理论保证。鼓励这一方法,我们提出用梯度流针对条件最优传输距离进行训练:这是经典 Wasserstein 距离的一个限制,强制执行我们的边际条件。依据度量空间中的梯度流理论,我们首先展示梯度流方程的良好定义性及其与有限宽度 ResNet 训练的一致性。随后,我们进行局部 Polyak-\L{}ojasiewicz 分析,表明对于恰当的初始化,梯度流收敛于全局最小化器:若特征数目有限但足够大,且初始风险足够小,则梯度流收敛。这类关于无限深任意宽 ResNet 的结果是首个。

关键词

引用

@article{arxiv.2403.12887,
  title  = {Understanding the training of infinitely deep and wide ResNets with Conditional Optimal Transport},
  author = {Raphaël Barboni and Gabriel Peyré and François-Xavier Vialard},
  journal= {arXiv preprint arXiv:2403.12887},
  year   = {2025}
}