神经算子的优化可受益于网络宽度
机器学习
2025-02-04 v1 最优化与控制
摘要
直接学习函数空间之间映射的神经算子,如深度算子网络(DON)和傅里叶神经算子(FNO),已受到广泛关注。尽管 DON 和 FNO 具有通用逼近性保证,但目前尚无使用梯度下降(GD)学习此类网络的优化收敛性保证。本文通过提出一个基于 GD 的统一优化框架,并将其应用于建立 DON 和 FNO 的收敛性保证,来解决这一开放问题。特别地,我们证明与这两种神经算子相关的损失函数满足两个条件——受限强凸性(RSC)和平滑性——这保证了 GD 能使其损失值下降。值得注意的是,由于各自模型架构差异的不同原因,每种神经算子都满足这两个条件。理论得出的一个结论是,更宽的网络应为 DON 和 FNO 带来更好的优化收敛性。我们展示了在典型算子学习问题上的实证结果,以支持我们的理论结果。
引用
@article{arxiv.2502.00705,
title = {Optimization for Neural Operators can Benefit from Width},
author = {Pedro Cisneros-Velarde and Bhavesh Shrimali and Arindam Banerjee},
journal= {arXiv preprint arXiv:2502.00705},
year = {2025}
}