用于高效 BERT 的细粒度与粗粒度混合自注意力
计算与语言
2022-03-18 v1
摘要
基于 Transformer 的预训练模型(如 BERT)在许多自然语言处理应用中取得了最先进的结果,展现出非凡的成功。然而,部署这些模型的成本可能高得令人望而却步,因为 Transformer 的标准自注意力机制在输入序列长度上承受二次计算成本。为此,我们提出 FCA,一种细粒度与粗粒度混合自注意力,通过逐步缩短自注意力中的计算序列长度来降低计算成本。具体而言,FCA 执行基于注意力的打分策略以确定每一层中各词元的信息量。随后,信息词元作为自注意力中的细粒度计算单元,而非信息词元被一个或多个簇所替代,作为自注意力中的粗粒度计算单元。在 GLUE 和 RACE 数据集上的实验表明,带有 FCA 的 BERT 相比原始 BERT 在 FLOPs 上实现了 2 倍削减,而准确率损失小于 1%。我们表明,与先前方法相比,FCA 在准确率与 FLOPs 之间提供了显著更优的权衡。
引用
@article{arxiv.2203.09055,
title = {Fine- and Coarse-Granularity Hybrid Self-Attention for Efficient BERT},
author = {Jing Zhao and Yifan Wang and Junwei Bao and Youzheng Wu and Xiaodong He},
journal= {arXiv preprint arXiv:2203.09055},
year = {2022}
}
备注
Accepted as ACL-2022