中文

深度算子网络的训练与泛化

数值分析 2023-09-06 v1 机器学习 数值分析 机器学习

摘要

我们提出了一种用于深度算子网络(DeepONets)的新训练方法,DeepONets 是最受欢迎的算子神经网络模型之一。DeepONets 由分支网络和主干网络两个子网络构成。通常,这两个子网络被同时训练,这相当于在高维空间中求解一个复杂的优化问题。此外,非凸和非线性的性质使得训练非常具有挑战性。为应对这一挑战,我们提出了一种两步训练方法,先训练主干网络,然后顺序训练分支网络。其核心机制受分而治之范式启发,是将整个复杂训练任务分解为两个复杂度降低的子任务。其中引入了 Gram-Schmidt 正交化过程,显著提高了稳定性和泛化能力。在理论方面,我们建立了关于训练数据量、DeepONets 宽度以及输入和输出传感器数量的泛化误差估计。给出了数值算例以证明两步训练方法的有效性,包括异质多孔介质中的 Darcy 流。

关键词

引用

@article{arxiv.2309.01020,
  title  = {On the training and generalization of deep operator networks},
  author = {Sanghyun Lee and Yeonjong Shin},
  journal= {arXiv preprint arXiv:2309.01020},
  year   = {2023}
}