中文

基于去噪的 UNMT 比基于 MASS 的 UNMT 对词序差异更具鲁棒性

计算与语言 2023-03-03 v1

摘要

我们旨在研究具有自监督预训练的 UNMT(无监督神经机器翻译)方法对语言对之间词序差异是否具有鲁棒性。我们通过比较以相同自监督预训练目标训练的两个模型来实现这一点。第一个模型在具有不同词序的语言对上训练,第二个模型在相同语言对上训练但将源语言重排序以匹配目标语言的词序。理想情况下,对词序差异鲁棒的 UNMT 方法在两种配置间应不表现出明显的性能差异。本文中,我们研究两种此类基于自监督预训练的 UNMT 方法,即掩码序列到序列预训练(MASS)(无打乱噪声)与去噪自编码器(DAE)(有打乱噪声)。我们使用五个英语\rightarrow印度语系语言对进行实验,即 en-hi、en-bn、en-gu、en-kn 与 en-ta,其中源语言词序为 SVO(主-谓-宾),目标语言词序为 SOV(主-宾-谓)。我们观察到,对于这些语言对,DAE 基 UNMT 方法在翻译准确率上始终优于 MASS。此外,使用重排序弥合词序鸿沟提升了 MASS 基 UNMT 模型的翻译准确率,却无法提升 DAE 基 UNMT 模型的翻译准确率。该观察表明 DAE 基 UNMT 比 MASS 基 UNMT 对词序差异更具鲁棒性。DAE 方法中的词打乱噪声可能是其对词序差异具有鲁棒性的原因。

关键词

引用

@article{arxiv.2303.01191,
  title  = {Denoising-based UNMT is more robust to word-order divergence than MASS-based UNMT},
  author = {Tamali Banerjee and Rudra Murthy and Pushpak Bhattacharyya},
  journal= {arXiv preprint arXiv:2303.01191},
  year   = {2023}
}