Fastformer:加性注意力即你所需要
计算与语言
2021-09-07 v6
摘要
Transformer 是一种用于文本理解的强大模型。然而,由于其相对于输入序列长度的二次复杂度,它效率低下。尽管已有许多 Transformer 加速方法,它们仍要么在长序列上效率不高,要么不够有效。本文中,我们提出 Fastformer,一种基于加性注意力的高效 Transformer 模型。在 Fastformer 中,我们不对词元之间的成对交互建模,而是首先使用加性注意力机制对全局上下文建模,随后基于每个词元表示与全局上下文表示的交互进一步变换该表示。以此方式,Fastformer 能以线性复杂度实现有效的上下文建模。在五个数据集上的大量实验表明,Fastformer 比许多现有 Transformer 模型高效得多,同时能取得可比甚至更好的长文本建模性能。
引用
@article{arxiv.2108.09084,
title = {Fastformer: Additive Attention Can Be All You Need},
author = {Chuhan Wu and Fangzhao Wu and Tao Qi and Yongfeng Huang and Xing Xie},
journal= {arXiv preprint arXiv:2108.09084},
year = {2021}
}
备注
Add results on Bing Ad CVR prediction