中文

预训练摘要蒸馏

计算与语言 2020-10-29 v2 人工智能

摘要

近期最先进的摘要方法利用大型预训练 Transformer 模型。将这些模型蒸馏为更小的学生模型对于实际应用已变得至关重要;然而 NLP 文献提出了许多不同的蒸馏方法。近期关于蒸馏 BERT 用于分类和回归任务的工作使用直接知识蒸馏展现出强劲性能。另一种做法是,机器翻译从业者使用伪标注进行蒸馏,即小模型在更大模型的翻译结果上进行训练。第三种更简单的方法是“压缩并微调”(SFT),它通过复制参数到更小的学生模型然后微调来避免任何显式蒸馏。我们比较了这三种用于蒸馏 Pegasus 和 BART(当前和此前最先进的预训练摘要模型)的方法,并发现 SFT 在 CNN/DailyMail 数据集上优于知识蒸馏和伪标注,但在更具抽象性的 XSUM 数据集上表现不如伪标注。不同大小的 PyTorch 代码和检查点可通过 Hugging Face transformers 在 http://tiny.cc/4iy0tz 获取。

关键词

引用

@article{arxiv.2010.13002,
  title  = {Pre-trained Summarization Distillation},
  author = {Sam Shleifer and Alexander M. Rush},
  journal= {arXiv preprint arXiv:2010.13002},
  year   = {2020}
}