通过多任务学习训练用于神经机器翻译的灵活深度模型
计算与语言
2020-10-19 v1 机器学习
摘要
标准神经机器翻译模型只能以与训练相同的深度配置进行解码。受此特性限制,我们必须部署不同大小的模型以维持相同的翻译延迟,因为不同终端设备(如手机)上的硬件条件可能差异巨大。这种单独训练导致模型维护成本增加与模型迭代变慢,对工业界尤甚。本工作中,我们提出使用多任务学习训练一个灵活深度模型,可在推理时适应不同深度配置。实验结果表明,我们的方法能同时支持24种深度配置的解码,且优于单独训练及另一种灵活深度模型训练方法——LayerDrop。
引用
@article{arxiv.2010.08265,
title = {Training Flexible Depth Model by Multi-Task Learning for Neural Machine Translation},
author = {Qiang Wang and Tong Xiao and Jingbo Zhu},
journal= {arXiv preprint arXiv:2010.08265},
year = {2020}
}
备注
Accepted at Findings of EMNLP 2020