中文

通过多任务学习训练用于神经机器翻译的灵活深度模型

计算与语言 2020-10-19 v1 机器学习

摘要

标准神经机器翻译模型只能以与训练相同的深度配置进行解码。受此特性限制,我们必须部署不同大小的模型以维持相同的翻译延迟,因为不同终端设备(如手机)上的硬件条件可能差异巨大。这种单独训练导致模型维护成本增加与模型迭代变慢,对工业界尤甚。本工作中,我们提出使用多任务学习训练一个灵活深度模型,可在推理时适应不同深度配置。实验结果表明,我们的方法能同时支持24种深度配置的解码,且优于单独训练及另一种灵活深度模型训练方法——LayerDrop。

关键词

引用

@article{arxiv.2010.08265,
  title  = {Training Flexible Depth Model by Multi-Task Learning for Neural Machine Translation},
  author = {Qiang Wang and Tong Xiao and Jingbo Zhu},
  journal= {arXiv preprint arXiv:2010.08265},
  year   = {2020}
}

备注

Accepted at Findings of EMNLP 2020