混合回归式神经机器翻译
计算与语言
2022-10-20 v1
摘要
在本工作中,我们通过实验确认带有迭代精炼机制的非自回归翻译(IR-NAT)加速鲁棒性差,因为其比自回归翻译(AT)对解码批大小与计算设备设置更为敏感。受此启发,我们尝试探究如何更好地结合自回归与非自回归翻译范式的优势。为此,我们通过合成实验证明,提示少量 AT 的预测可促使一次性非自回归翻译达到与 IR-NAT 相当的性能。沿此思路,我们提出一种称为混合回归式翻译(HRT)的新两阶段翻译原型。具体而言,HRT 首先通过自回归生成不连续序列(例如每 k 个词(k>1)做一次预测),然后以非自回归方式一次性填充所有此前跳过的词。我们还提出一组技术,在不增加任何模型参数的情况下高效且有效地训练 HRT。HRT 在 WMT En-De 任务上取得 28.49 的 SOTA BLEU 分数,且无论批大小与设备如何,均至少比 AT 快 1.5 倍。此外,HRT 的另一额外好处是成功继承了 AT 在深编码器-浅解码器架构中的优良特性。具体地,相较于具有 6 层编码器和 6 层解码器的原始 HRT,具有 12 层编码器和 1 层解码器的 HRT 在 GPU 与 CPU 上推理速度均进一步翻倍且无 BLEU 损失。
引用
@article{arxiv.2210.10416,
title = {Hybrid-Regressive Neural Machine Translation},
author = {Qiang Wang and Xinhui Hu and Ming Chen},
journal= {arXiv preprint arXiv:2210.10416},
year = {2022}
}
备注
Submitted to ICLR 2023