非自回归神经机器翻译中两语言共享的潜在空间
计算与语言
2024-09-10 v2 机器学习
摘要
非自回归神经机器翻译(NAT)相较于自回归神经机器翻译(AT)提供了大幅的翻译加速,但代价是翻译质量。潜变量建模已成为弥合该质量差距的一种有前景的方法,尤其用于解决 NAT 中长期存在的多模态问题。在先前使用潜变量建模的工作中,他们添加了一个辅助模型来估计以源句和目标句为条件的潜变量后验分布。然而,这导致了若干缺点,例如潜变量中的冗余信息抽取、参数数量增加,以及倾向于忽略来自输入的某些信息。在本文中,我们提出了一种新颖的潜变量建模,它集成了双重重构视角与先进的分层潜变量建模,并具有跨语言共享的中间潜在空间。该潜变量建模假设能缓解或防止上述缺点。在我们的实验结果中,我们给出了全面展示,表明我们提出的方法推断出更优的潜变量,从而带来更好的翻译质量。最后,在 WMT 等基准翻译任务中,我们证明所提方法相比先前的 NAT 基线(包括最先进的 NAT 模型)显著提升了翻译质量。
引用
@article{arxiv.2305.03511,
title = {Shared Latent Space by Both Languages in Non-Autoregressive Neural Machine Translation},
author = {DongNyeong Heo and Heeyoul Choi},
journal= {arXiv preprint arXiv:2305.03511},
year = {2024}
}