非自回归翻译中词汇选择的理解与改进
计算与语言
2021-01-28 v2
摘要
知识蒸馏(KD)通过自回归教师模型降低原始数据的复杂度,对训练非自回归翻译(NAT)模型至关重要。本研究中,我们经实证表明,作为该训练的一种副作用,低频词上的词汇选择错误会从教师模型传播至 NAT 模型。为缓解此问题,我们提出将原始数据暴露给 NAT 模型,以恢复蒸馏数据中缺失的低频词有用信息。为此,我们引入一个额外的 Kullback-Leibler 散度项,由比较 NAT 模型的词汇选择与该原始数据中嵌入的词汇选择得到。跨语言对与模型架构的实验结果证明了所提方法的有效性与普适性。大量分析证实了我们的论断:该方法通过减少低频词上的词汇选择错误来提升性能。令人鼓舞的是,我们的方法将 WMT14 英德与 WMT16 罗英数据集上的 SOTA NAT 性能分别推高至 27.8 和 33.8 BLEU 点。源代码将公开发布。
引用
@article{arxiv.2012.14583,
title = {Understanding and Improving Lexical Choice in Non-Autoregressive Translation},
author = {Liang Ding and Longyue Wang and Xuebo Liu and Derek F. Wong and Dacheng Tao and Zhaopeng Tu},
journal= {arXiv preprint arXiv:2012.14583},
year = {2021}
}
备注
ICLR 2021