带辅助正则化的非自回归机器翻译
计算与语言
2019-02-28 v1 机器学习
机器学习
摘要
作为一种新的神经机器翻译方法,非自回归机器翻译(NAT)近期因其推理的高效性而受到关注。然而,该高效性是以未捕捉翻译目标侧的序列依赖为代价的,这导致 NAT 遭受两类翻译错误:1)重复翻译(由于相邻解码器隐状态不可区分),以及 2)不完整翻译(由于通过解码器隐状态从源侧传递信息不完整)。在本文中,我们提出在 NAT 模型训练过程中通过两个辅助正则化项提升解码器隐表示的质量来解决这两个问题。首先,为使隐状态更具可区分性,我们基于对应目标词元正则化连续隐状态之间的相似性。其次,为迫使隐状态包含源句中的所有信息,我们利用翻译任务的双重性(例如英语到德语与德语到英语)并最小化反向重构误差,以确保 NAT 解码器的隐状态能够恢复源侧句子。在多个基准数据集上开展的广泛实验表明,两种正则化策略均有效,并能缓解 NAT 模型中的重复翻译与不完整翻译问题。因此,NAT 模型的精度相较最先进的 NAT 模型得到显著提升,且推理效率更优。
引用
@article{arxiv.1902.10245,
title = {Non-Autoregressive Machine Translation with Auxiliary Regularization},
author = {Yiren Wang and Fei Tian and Di He and Tao Qin and ChengXiang Zhai and Tie-Yan Liu},
journal= {arXiv preprint arXiv:1902.10245},
year = {2019}
}
备注
AAAI 2019