中文

一种用于稀疏深度神经网络架构的自适应且促进稳定性的逐层训练方法

机器学习 2024-09-24 v2 最优化与控制

摘要

本工作提出一种两阶段自适应框架,用于逐步发展对给定训练数据集泛化良好的深度神经网络(DNN)架构。在第一阶段,采用逐层训练方法,每次添加一个新层并通过冻结前层参数独立训练。我们通过引入流形正则化、稀疏正则化与物理信息项对 DNN 施加期望结构。我们引入 epsilon-delta 稳定性促进概念作为学习算法的期望性质,并表明采用流形正则化可得到 epsilon-delta 稳定性促进算法。进一步,我们还推导了新添层可训练性的必要条件并研究训练饱和问题。在算法的第二阶段(后处理)中,采用一系列浅层网络从第一阶段产生的残差中提取信息,从而提升预测精度。在原型回归与分类问题上的数值研究证明,所提方法可胜过同等规模的 fully connected DNNs。此外,通过将物理信息神经网络(PINN)配备所提自适应架构策略以求解偏微分方程,我们从数值上表明自适应 PINN 不仅优于标准 PINN,还产生具有可证稳定性的可解释隐藏层。我们也将架构设计策略应用于求解由椭圆偏微分方程控制的反问题。

关键词

引用

@article{arxiv.2211.06860,
  title  = {An Adaptive and Stability-Promoting Layerwise Training Approach for Sparse Deep Neural Network Architecture},
  author = {C G Krishnanunni and Tan Bui-Thanh},
  journal= {arXiv preprint arXiv:2211.06860},
  year   = {2024}
}