理解与改进用于神经机器翻译的序列到序列预训练
计算与语言
2022-03-17 v1 人工智能
摘要
本文在更好地理解用于神经机器翻译(NMT)的 SOTA 序列到序列(Seq2Seq)预训练方面迈出了重要一步。我们聚焦于研究联合预训练的译码器的影响,这是 Seq2Seq 预训练与先前基于编码器的 NMT 预训练方法的主要区别。通过在三个语言对上仔细设计实验,我们发现 Seq2Seq 预训练是一把双刃剑:一方面,它帮助 NMT 模型产生更多样化的翻译并减少充分性相关的翻译错误;另一方面,Seq2Seq 预训练与 NMT 微调之间的差异限制了翻译质量(即领域差异)并引发了过高估计问题(即目标差异)。基于这些观察,我们进一步提出了简单而有效的策略,即域内预训练和输入适配,分别补救领域差异和目标差异。在多个语言对上的实验结果表明,我们的方法相较于 Seq2Seq 预训练能一致地改善翻译性能和模型鲁棒性。
引用
@article{arxiv.2203.08442,
title = {Understanding and Improving Sequence-to-Sequence Pretraining for Neural Machine Translation},
author = {Wenxuan Wang and Wenxiang Jiao and Yongchang Hao and Xing Wang and Shuming Shi and Zhaopeng Tu and Michael Lyu},
journal= {arXiv preprint arXiv:2203.08442},
year = {2022}
}
备注
Accepted by ACL 2022 main conference