中文

论多语言神经机器翻译中的捷径学习

计算与语言 2024-11-19 v1 人工智能

摘要

在这项研究中,我们重新审视了多语言神经机器翻译(MNMT)中常被引用的脱靶问题。通过在不同MNMT场景和模型上精心设计实验,我们将脱靶问题归因于(非中心语言,中心语言)语言映射的捷径过拟合。具体来说,学习到的捷径偏向于MNMT在零样本翻译中错误地将非中心语言翻译成中心语言,而不是预期的非中心语言。对学习动态的分析表明,捷径学习通常发生在模型训练的后期阶段,而多语言预训练加速并加剧了捷径学习。基于这些观察,我们提出了一种简单有效的训练策略,通过利用模型训练的遗忘特性来消除MNMT模型中的捷径。与标准训练的唯一区别在于,我们在模型训练的后期阶段移除了可能诱导捷径学习的训练实例。在不引入任何额外数据和计算成本的情况下,我们的方法可以通过缓解不同MNMT模型和基准测试中的捷径学习,持续且显著地提升零样本翻译性能。

关键词

引用

@article{arxiv.2411.10581,
  title  = {On the Shortcut Learning in Multilingual Neural Machine Translation},
  author = {Wenxuan Wang and Wenxiang Jiao and Jen-tse Huang and Zhaopeng Tu and Michael R. Lyu},
  journal= {arXiv preprint arXiv:2411.10581},
  year   = {2024}
}

备注

Accepted by Neurocomputing 2024