唤醒低频词:在非自回归翻译中充分利用平行数据
计算与语言
2022-04-27 v2 人工智能
摘要
知识蒸馏(KD)常用于构造合成数据以训练非自回归翻译(NAT)模型。然而,蒸馏数据与原始数据在低频词上存在差异,导致预测低频词时产生更多错误。为缓解该问题,我们通过利用预训练将原始数据直接暴露给 NAT。通过分析有向对齐,我们发现 KD 使低频源词更确定地对齐到目标端,但未能从目标端到源端对齐充足的低频词。相应地,我们提出反向 KD 以唤醒更多低频目标词的对齐。为充分利用真实与合成数据,我们将这些互补方法结合作为一种新训练策略,以进一步提升 NAT 性能。我们在两个先进架构上的五个翻译基准上开展实验。结果表明,所提方法能通过减少低频词上的翻译错误显著且普遍地改善翻译质量。令人鼓舞的是,我们的方法在 WMT14 英德与 WMT16 罗英数据集上分别取得 28.2 与 33.9 个 BLEU 点。我们的代码、数据与训练模型见于 \url{https://github.com/alphadl/RLFW-NAT}。
引用
@article{arxiv.2106.00903,
title = {Rejuvenating Low-Frequency Words: Making the Most of Parallel Data in Non-Autoregressive Translation},
author = {Liang Ding and Longyue Wang and Xuebo Liu and Derek F. Wong and Dacheng Tao and Zhaopeng Tu},
journal= {arXiv preprint arXiv:2106.00903},
year = {2022}
}
备注
ACL 2021