选择Transformer:傅里叶还是伽辽金
机器学习
2021-11-02 v4 数值分析
数值分析
摘要
本文首次将Attention Is All You Need中前沿Transformer的自注意力机制应用于与偏微分方程相关的数据驱动算子学习问题。我们共同努力解释注意力机制的启发式原理并提升其效能。通过运用Hilbert空间中的算子逼近理论,首次证明缩放点积注意力中的softmax归一化是充分但非必要的。无softmax时,可证明线性化Transformer变体的逼近能力逐层相当于Petrov-Galerkin投影,且该估计独立于序列长度。提出一种模仿Petrov-Galerkin投影的新层归一化方案,以允许缩放通过注意力层传播,帮助模型在未归一化数据的算子学习任务中达到显著精度。最后,我们给出三个算子学习实验,包括黏性Burgers方程、界面Darcy流以及界面系数反识别问题。新提出的简易基于注意力的算子学习器——Galerkin Transformer,相比其softmax归一化对应模型在训练成本与评估精度上均有显著提升。
引用
@article{arxiv.2105.14995,
title = {Choose a Transformer: Fourier or Galerkin},
author = {Shuhao Cao},
journal= {arXiv preprint arXiv:2105.14995},
year = {2021}
}
备注
35 pages, 13 figures. Published as a conference paper at NeurIPS 2021