LazyFormer:带惰性更新的自注意力
计算与语言
2021-02-26 v1 人工智能
摘要
提升基于Transformer的语言预训练效率是自然语言处理(NLP)中的一项重要任务,尤其是对于计算代价高昂的自注意力模块。本文提出一种简单而有效的方案,称为LazyFormer,它不频繁地计算自注意力分布。LazyFormer由多个惰性块组成,每个惰性块包含多个Transformer层。在每个惰性块中,自注意力分布仅在首层计算一次,然后在所有上层中复用。以此方式,可大幅节省计算开销。我们还提供了若干LazyFormer的训练技巧。大量实验证明了所提方法的有效性。
引用
@article{arxiv.2102.12702,
title = {LazyFormer: Self Attention with Lazy Update},
author = {Chengxuan Ying and Guolin Ke and Di He and Tie-Yan Liu},
journal= {arXiv preprint arXiv:2102.12702},
year = {2021}
}