从深层 Transformer 中学习轻量翻译模型
计算与语言
2020-12-29 v1
摘要
近来,深层模型在神经机器翻译(NMT)中展现出巨大改进。然而,此类系统计算开销大且内存密集。本文朝学习强劲而轻量的 NMT 系统迈出自然一步。我们提出一种新颖的基于组置换的知识蒸馏方法,将深层 Transformer 模型压缩为浅层模型。在多个基准上的实验结果验证了方法的有效性。我们的压缩模型比深层模型浅 8 倍,BLEU 几乎无损失。为进一步增强教师模型,我们提出跳跃子层方法,随机省略子层以在训练中引入扰动,其在英德 newstest2014 上取得了 30.63 的 BLEU 分数。代码已公开于 https://github.com/libeineu/GPKD。
引用
@article{arxiv.2012.13866,
title = {Learning Light-Weight Translation Models from Deep Transformer},
author = {Bei Li and Ziyang Wang and Hui Liu and Quan Du and Tong Xiao and Chunliang Zhang and Jingbo Zhu},
journal= {arXiv preprint arXiv:2012.13866},
year = {2020}
}
备注
Accepted by AAAI2021