为文本生成蒸馏 BERT 中学到的知识
计算与语言
2020-07-21 v3 机器学习
摘要
诸如 BERT 的大规模预训练语言模型在语言理解任务中已取得巨大成功。然而,如何利用 BERT 进行语言生成仍是一个开放问题。本文中,我们提出一种新方法——条件掩码语言建模(Conditional Masked Language Modeling, C-MLM),以使 BERT 能在目标生成任务上微调。微调后的 BERT(教师)被用作额外监督以改进常规的 Seq2Seq 模型(学生),从而获得更好的文本生成性能。通过利用 BERT 特有的双向特性,蒸馏 BERT 中学到的知识可鼓励自回归 Seq2Seq 模型提前规划,施加全局序列级监督以实现连贯文本生成。实验表明,所提方法在机器翻译与文本摘要等多个语言生成任务上显著优于强 Transformer 基线。我们提出的模型在 IWSLT 德英与英越机器翻译数据集上也达到了新的 state of the art。代码见 https://github.com/ChenRocks/Distill-BERT-Textgen。
引用
@article{arxiv.1911.03829,
title = {Distilling Knowledge Learned in BERT for Text Generation},
author = {Yen-Chun Chen and Zhe Gan and Yu Cheng and Jingzhou Liu and Jingjing Liu},
journal= {arXiv preprint arXiv:1911.03829},
year = {2020}
}
备注
ACL 2020