中文

LazyFormer:带惰性更新的自注意力

计算与语言 2021-02-26 v1 人工智能

摘要

提升基于Transformer的语言预训练效率是自然语言处理(NLP)中的一项重要任务,尤其是对于计算代价高昂的自注意力模块。本文提出一种简单而有效的方案,称为LazyFormer,它不频繁地计算自注意力分布。LazyFormer由多个惰性块组成,每个惰性块包含多个Transformer层。在每个惰性块中,自注意力分布仅在首层计算一次,然后在所有上层中复用。以此方式,可大幅节省计算开销。我们还提供了若干LazyFormer的训练技巧。大量实验证明了所提方法的有效性。

关键词

引用

@article{arxiv.2102.12702,
  title  = {LazyFormer: Self Attention with Lazy Update},
  author = {Chengxuan Ying and Guolin Ke and Di He and Tie-Yan Liu},
  journal= {arXiv preprint arXiv:2102.12702},
  year   = {2021}
}