用于神经机器翻译的可扩展Transformers
计算与语言
2021-06-21 v2
摘要
Transformer因其大容量和序列生成的并行训练而被广泛采用于神经机器翻译(NMT)。然而,Transformer的部署具有挑战性,因为不同场景需要不同复杂度和规模的模型。朴素地训练多个Transformer在计算和内存上都是冗余的。本文中,我们提出一种新颖的可扩展Transformers(Scalable Transformers),其天然包含不同规模的子Transformer且参数共享。每个子Transformer可通过裁剪最大Transformer的参数轻松获得。我们提出了一个三阶段训练方案来解决可扩展Transformers的训练困难,该方案引入了来自词级和序列级自蒸馏的额外监督。我们在WMT EN-De和En-Fr上进行了大量实验以验证我们提出的可扩展Transformers。
引用
@article{arxiv.2106.02242,
title = {Scalable Transformers for Neural Machine Translation},
author = {Peng Gao and Shijie Geng and Yu Qiao and Xiaogang Wang and Jifeng Dai and Hongsheng Li},
journal= {arXiv preprint arXiv:2106.02242},
year = {2021}
}
备注
Mostly overlapping with version 1, with minor updates/revisions