中文

通过随机抽样提高深度神经算子网络的高效训练

机器学习 2025-06-03 v2 数据分析、统计与概率 机器学习

摘要

神经算子(Neural Operator, NOs)采用深度神经网络来学习函数空间之间的映射。深度算子网络(DeepONet)是一种流行的 NO 架构,在 various 科学和工程应用中已展示出成功于实时预测复杂动态。在本工作中,我们引入一种随机抽样技术,用于 DeepONet 训练中,以提高模型的泛化能力,同时显著减少计算时间。该方法旨在作用于 DeepONet 模型的 trunk 网络,该网络输出对应于受限域上特定时空位置的基函数的输出。在构建损失函数时,DeepONet 训练传统上考虑在每个迭代中对所有输出函数评估的均匀时空点网格。这种方法导致较大的 batch 大小,造成泛化性能差和增加内存需求,因为受随机梯度下降(SGD)优化器限制。我们提出的对 trunk 网络输入进行随机抽样可缓解这些挑战,提高泛化性并降低训练期间的内存需求,从而实现显著的计算收益。我们通过三个基准示例验证了假设,展示了在训练时间大幅减少的同时实现与传统训练方法相当或更低的总体测试误差。我们的结果表明,在训练期间将随机性纳入 trunk 网络输入可增强 DeepONet 的效率和鲁棒性,为改进该框架在建模复杂物理系统方面的性能提供了前景。

关键词

引用

@article{arxiv.2409.13280,
  title  = {Efficient Training of Deep Neural Operator Networks via Randomized Sampling},
  author = {Sharmila Karumuri and Lori Graham-Brady and Somdatta Goswami},
  journal= {arXiv preprint arXiv:2409.13280},
  year   = {2025}
}