中文

用于神经机器翻译的可扩展Transformers

计算与语言 2021-06-21 v2

摘要

Transformer因其大容量和序列生成的并行训练而被广泛采用于神经机器翻译(NMT)。然而,Transformer的部署具有挑战性,因为不同场景需要不同复杂度和规模的模型。朴素地训练多个Transformer在计算和内存上都是冗余的。本文中,我们提出一种新颖的可扩展Transformers(Scalable Transformers),其天然包含不同规模的子Transformer且参数共享。每个子Transformer可通过裁剪最大Transformer的参数轻松获得。我们提出了一个三阶段训练方案来解决可扩展Transformers的训练困难,该方案引入了来自词级和序列级自蒸馏的额外监督。我们在WMT EN-De和En-Fr上进行了大量实验以验证我们提出的可扩展Transformers。

关键词

引用

@article{arxiv.2106.02242,
  title  = {Scalable Transformers for Neural Machine Translation},
  author = {Peng Gao and Shijie Geng and Yu Qiao and Xiaogang Wang and Jifeng Dai and Hongsheng Li},
  journal= {arXiv preprint arXiv:2106.02242},
  year   = {2021}
}

备注

Mostly overlapping with version 1, with minor updates/revisions