中文

过参数化物理信息神经网络的自然梯度下降收敛性分析

机器学习 2025-06-16 v4

摘要

在过参数化背景下,有一系列工作证明随机初始化的(随机)梯度下降(GD)对于二次损失函数以线性收敛速率收敛到全局最优解。然而,GD 在训练两层神经网络时的学习率对样本量和 Gram 矩阵表现出较差的依赖性,导致训练过程缓慢。在本文中,我们证明在训练两层 ReLU3\text{ReLU}^3 物理信息神经网络(PINNs)时,学习率可以从 O(λ0)\mathcal{O}(\lambda_0) 提升至 O(1/H2)\mathcal{O}(1/\|\bm{H}^{\infty}\|_2),这意味着 GD 实际上享有更快的收敛速率。尽管有了这些改进,收敛速率仍然与 Gram 矩阵的最小特征值绑定,导致收敛缓慢。然后我们发展了具有一般光滑激活函数的 Gram 矩阵的正定性,并提供了自然梯度下降(NGD)训练两层 PINNs 的收敛性分析,证明学习率可以为 O(1)\mathcal{O}(1),且在此速率下收敛速率与 Gram 矩阵无关。特别地,对于光滑激活函数,NGD 的收敛速率是二次的。我们进行了数值实验以验证理论结果。

关键词

引用

@article{arxiv.2408.00573,
  title  = {Convergence Analysis of Natural Gradient Descent for Over-parameterized Physics-Informed Neural Networks},
  author = {Xianliang Xu and Ting Du and Wang Kong and Bin Shan and Ye Li and Zhongyi Huang},
  journal= {arXiv preprint arXiv:2408.00573},
  year   = {2025}
}