中文

FNet:用傅里叶变换混合词元

计算与语言 2022-05-30 v4 机器学习

摘要

我们表明,通过用简单的线性变换替换自注意力子层来“混合”输入词元,可以在有限的精度代价下加速 Transformer 编码器架构。这些线性混合器,连同前馈层中的标准非线性,在多个文本分类任务中被证明能够胜任语义关系建模。最令人惊讶的是,我们发现用标准的、无参数的傅里叶变换替换 Transformer 编码器中的自注意力子层,在 GLUE 基准上达到了 BERT 对应模型 92–97% 的准确率,但在标准 512 输入长度下在 GPU 上训练快 80%,在 TPU 上快 70%。在更长的输入长度下,我们的 FNet 模型显著更快:与 Long Range Arena 基准上的“高效”Transformer 相比,FNet 匹配了最准确模型的准确率,同时在 GPU 上所有序列长度(以及在 TPU 上相对较短的长度)上超越了最快的模型。最后,FNet 内存占用小,并且在较小模型规模下尤其高效;在固定的速度和准确率预算下,小型 FNet 模型优于 Transformer 对应模型。

关键词

引用

@article{arxiv.2105.03824,
  title  = {FNet: Mixing Tokens with Fourier Transforms},
  author = {James Lee-Thorp and Joshua Ainslie and Ilya Eckstein and Santiago Ontanon},
  journal= {arXiv preprint arXiv:2105.03824},
  year   = {2022}
}

备注

To appear at NAACL 2022