中文

编码器内部的语言迁移:零样本多语言翻译中的表示迁移

计算与语言 2025-04-09 v2

摘要

理解多语言神经机器翻译(MNMT)中的表示迁移,可揭示零样本翻译不足的原因。本文系统性地分析了MNMT模型的表示问题。首先,我们引入同一对(identity pair),即将句子翻译为自身,以弥补多语言研究中缺乏基准测量的问题,因为同一对能反映模型中某一语言的表示。随后,我们展示了编码器将源语言迁移到目标语言的表示子空间,而非语言无关状态。因此,零样本翻译不足的根源在于翻译表示被其他语言所 entangled,且未能有效迁移到目标语言。基于我们的发现,我们提出两种方法:1)编码器中的低秩语言特定嵌入,以及2)解码器中的语言特定对比学习。在Europarl-15、TED-19和OPUS-100数据集上的实验结果表明,我们的方法在不损失监督方向性能的前提下,显著提升了零样本翻译性能,通过提高语言迁移能力,为我们的结论提供了实证依据。代码已公开于 https://github.com/zhiqu22/ZeroTrans。

关键词

引用

@article{arxiv.2406.08092,
  title  = {Languages Transferred Within the Encoder: On Representation Transfer in Zero-Shot Multilingual Translation},
  author = {Zhi Qu and Chenchen Ding and Taro Watanabe},
  journal= {arXiv preprint arXiv:2406.08092},
  year   = {2025}
}

备注

Accepted by MT Summit 2025