跨语言嵌入在无监督神经机器翻译中不可或缺:以英语到印度-雅利安语为例
计算与语言
2021-06-10 v1 机器学习
摘要
无监督神经机器翻译(UNMT)的近期进展已使密切相近语言对之间的监督与无监督机器翻译性能差距最小化。然而,对于远距离语言对情况截然不同。缺乏词汇重叠与低句法相似性,例如英语与印度-雅利安语言之间,导致现有UNMT系统翻译质量低下。本文中,我们表明用跨语言嵌入初始化UNMT模型的嵌入层相比以随机初始化嵌入的现有方法在BLEU分数上有显著提升。此外,静态嵌入(冻结嵌入层权重)相比在训练中更新嵌入层权重(非静态)带来更好增益。我们使用掩码序列到序列(MASS)与去噪自编码器(DAE)UNMT方法对三对远距离语言进行了实验。所提出的跨语言嵌入初始化相较基线在英-印地语、英-孟加拉语与英-古吉拉特语上带来高达十倍的BLEU分数提升。我们的分析显示了跨语言嵌入的重要性、方法间比较以及这些系统的改进空间。
引用
@article{arxiv.2106.04995,
title = {Crosslingual Embeddings are Essential in UNMT for Distant Languages: An English to IndoAryan Case Study},
author = {Tamali Banerjee and Rudra Murthy and Pushpak Bhattacharyya},
journal= {arXiv preprint arXiv:2106.04995},
year = {2021}
}