中文

用于可扩展训练物理信息神经网络的对偶自然梯度下降

机器学习 2025-10-09 v2 最优化与控制

摘要

自然梯度方法显著加速了物理信息神经网络(PINN)的训练,但其 Gauss-Newton 更新必须在参数空间中求解,产生令人望而却步的 O(n3)O(n^3) 时间复杂度,其中 nn 为网络可训练权重数。我们证明,完全相同的步骤可以改在一个通常更小的、大小为 m=γNγdγm = \sum_{\gamma} N_{\gamma} d_{\gamma} 的残差空间中表述,其中每个残差类 γ\gamma(例如 PDE 内部、边界、初始数据)贡献 NγN_{\gamma} 个输出维度为 dγd_{\gamma} 的配点。基于这一洞察,我们引入了对偶自然梯度下降(D-NGD)。D-NGD 在残差空间中计算 Gauss-Newton 步,以可忽略的额外代价增加了测地加速校正,并为适中的 mm 提供了稠密直接求解器,为较大的 mm 提供了 Nyström 预条件共轭梯度求解器。实验表明,D-NGD 将二阶 PINN 优化扩展至具有多达 1280 万参数的网络,最终误差 L2L^2 比一阶方法(Adam、SGD)和拟牛顿方法低一到三个数量级,并且——至关重要的是——能够在单 GPU 上实现此规模下的 PINN 自然梯度训练。

关键词

引用

@article{arxiv.2505.21404,
  title  = {Dual Natural Gradient Descent for Scalable Training of Physics-Informed Neural Networks},
  author = {Anas Jnini and Flavio Vella},
  journal= {arXiv preprint arXiv:2505.21404},
  year   = {2025}
}