中文

摘要系统中编码器-解码器注意力的稀疏性与句子结构

计算与语言 2021-09-10 v1

摘要

Transformer 模型在包括摘要在内的众多 NLP 任务中取得了最先进的结果。使用大型 Transformer 模型进行训练和推理的计算成本可能很高。先前的工作聚焦于一个重要的瓶颈,即编码器中的二次自注意力机制。LED 或 LoBART 等改进的编码器架构使用局部注意力模式来解决摘要任务中的这一问题。相比之下,本工作聚焦于 Transformer 的编码器-解码器注意力机制。在需要模型生成历史的推理或训练方法中,这种注意力的成本变得更加显著。首先,我们考察了编码器-解码器注意力的复杂度。我们通过实验证明,文档摘要中存在一种稀疏的句子结构,可以通过将注意力机制约束到输入句子的一个子集来利用这一结构,同时保持系统性能。其次,我们提出了一种改进的架构,用于选择句子子集以约束编码器-解码器注意力。实验在抽象式摘要任务上进行,包括 CNN/DailyMail、XSum、Spotify Podcast 和 arXiv。

关键词

引用

@article{arxiv.2109.03888,
  title  = {Sparsity and Sentence Structure in Encoder-Decoder Attention of Summarization Systems},
  author = {Potsawee Manakul and Mark J. F. Gales},
  journal= {arXiv preprint arXiv:2109.03888},
  year   = {2021}
}

备注

EMNLP 2021 (short paper, main conference)