通过去噪训练改进神经机器翻译
计算与语言
2022-01-21 v2
摘要
我们提出一种简单而有效的神经机器翻译预训练策略——去噪训练DoT。具体而言,我们在早期阶段以源端与目标端去噪任务更新模型参数,随后正常微调模型。值得注意的是,我们的方法不增加任何参数或训练步数,仅需平行数据。实验表明,DoT在12个双语与16个多语方向上(数据规模从80K到20M不等)持续提升神经机器翻译性能。此外,我们展示DoT可补充现有数据操控策略,即课程学习、知识蒸馏、数据多样化、双向训练与回译。令人鼓舞的是,我们发现DoT在高资源设定下优于昂贵的预训练模型mBART。分析显示DoT是一种新颖的域内跨语言预训练策略,并可通过任务相关的自监督提供进一步改进。
引用
@article{arxiv.2201.07365,
title = {Improving Neural Machine Translation by Denoising Training},
author = {Liang Ding and Keqin Peng and Dacheng Tao},
journal= {arXiv preprint arXiv:2201.07365},
year = {2022}
}
备注
arXiv admin note: text overlap with arXiv:2109.07780