中文

选择Transformer:傅里叶还是伽辽金

机器学习 2021-11-02 v4 数值分析 数值分析

摘要

本文首次将Attention Is All You Need中前沿Transformer的自注意力机制应用于与偏微分方程相关的数据驱动算子学习问题。我们共同努力解释注意力机制的启发式原理并提升其效能。通过运用Hilbert空间中的算子逼近理论,首次证明缩放点积注意力中的softmax归一化是充分但非必要的。无softmax时,可证明线性化Transformer变体的逼近能力逐层相当于Petrov-Galerkin投影,且该估计独立于序列长度。提出一种模仿Petrov-Galerkin投影的新层归一化方案,以允许缩放通过注意力层传播,帮助模型在未归一化数据的算子学习任务中达到显著精度。最后,我们给出三个算子学习实验,包括黏性Burgers方程、界面Darcy流以及界面系数反识别问题。新提出的简易基于注意力的算子学习器——Galerkin Transformer,相比其softmax归一化对应模型在训练成本与评估精度上均有显著提升。

关键词

引用

@article{arxiv.2105.14995,
  title  = {Choose a Transformer: Fourier or Galerkin},
  author = {Shuhao Cao},
  journal= {arXiv preprint arXiv:2105.14995},
  year   = {2021}
}

备注

35 pages, 13 figures. Published as a conference paper at NeurIPS 2021