过参数化物理信息神经网络的自然梯度下降收敛性分析
机器学习
2025-06-16 v4
摘要
在过参数化背景下,有一系列工作证明随机初始化的(随机)梯度下降(GD)对于二次损失函数以线性收敛速率收敛到全局最优解。然而,GD 在训练两层神经网络时的学习率对样本量和 Gram 矩阵表现出较差的依赖性,导致训练过程缓慢。在本文中,我们证明在训练两层 物理信息神经网络(PINNs)时,学习率可以从 提升至 ,这意味着 GD 实际上享有更快的收敛速率。尽管有了这些改进,收敛速率仍然与 Gram 矩阵的最小特征值绑定,导致收敛缓慢。然后我们发展了具有一般光滑激活函数的 Gram 矩阵的正定性,并提供了自然梯度下降(NGD)训练两层 PINNs 的收敛性分析,证明学习率可以为 ,且在此速率下收敛速率与 Gram 矩阵无关。特别地,对于光滑激活函数,NGD 的收敛速率是二次的。我们进行了数值实验以验证理论结果。
引用
@article{arxiv.2408.00573,
title = {Convergence Analysis of Natural Gradient Descent for Over-parameterized Physics-Informed Neural Networks},
author = {Xianliang Xu and Ting Du and Wang Kong and Bin Shan and Ye Li and Zhongyi Huang},
journal= {arXiv preprint arXiv:2408.00573},
year = {2025}
}