基于拓扑导数的深度神经网络架构适应方法
机器学习
2026-03-03 v2 人工智能
摘要
本工作提出了一种用于沿网络深度逐步适应神经网络架构的新算法。具体而言,我们试图以数学原理的方式回答以下问题:i) 在训练过程中,在何处添加新的容量(层)?ii)如何初始化新的容量?我们方法的核心是两个关键要素:i)引入一个取决于神经网络拓扑结构的“形状泛函”,并将其最小化;ii)引入关于神经网络拓扑结构的形状泛函的拓扑导数。我们从最优控制的视角表明,在满足 certain(特定)条件下,网络拓扑导数是存在的,并推导出其闭式表达式。特别地,我们首次探讨了拓扑优化框架中的拓扑导数与最优控制理论中的哈姆顿量之间的联系。进一步表明,形状泛函的最优性条件导致深层神经网络架构适应的特征值问题。因此,我们的方法确定了训练阶段需要在深度中插入新层的最敏感位置,以及新添加层的相关参数初始化。我们还展示了层插入策略可从最优传输视角推导得出,即作为在 -Wasserstein 空间中最大化拓扑导数的解,其中 。在多个回归和分类问题上进行的 numerical(数值)实验表明,我们提出的方法优于 ad-hoc(特定)基准网络和其他架构适应策略。进一步,我们还展示了拓扑导数在转移学习等领域的其他应用。
引用
@article{arxiv.2502.06885,
title = {Topological derivative approach for deep neural network architecture adaptation},
author = {C G Krishnanunni and Tan Bui-Thanh and Clint Dawson},
journal= {arXiv preprint arXiv:2502.06885},
year = {2026}
}