中文

注意力温度在摘要生成蒸馏中的影响

计算与语言 2022-03-02 v3

摘要

摘要生成文本的最新进展很大程度上依赖于大型预训练序列到序列 Transformer 模型,其计算代价高昂。本文旨在将这些大型模型蒸馏为更小的模型,以实现更快推理和最小性能损失。基于伪标注的方法在序列到序列模型蒸馏中很流行。本文中,我们发现简单地操控 Transformer 中的注意力温度可使伪标注更易于被学生模型学习。我们在三个摘要数据集上的实验表明,所提方法持续优于原始的基于伪标注的方法。我们还发现,由我们的学生模型生成的伪标注和摘要都更短且更具抽象性。我们的代码可在 \url{https://github.com/Shengqiang-Zhang/plate} 获取。

关键词

引用

@article{arxiv.2106.03441,
  title  = {Attention Temperature Matters in Abstractive Summarization Distillation},
  author = {Shengqiang Zhang and Xingxing Zhang and Hangbo Bao and Furu Wei},
  journal= {arXiv preprint arXiv:2106.03441},
  year   = {2022}
}

备注

Accepted in ACL 2022 Main conference