论多语言神经机器翻译中的捷径学习
计算与语言
2024-11-19 v1 人工智能
摘要
在这项研究中,我们重新审视了多语言神经机器翻译(MNMT)中常被引用的脱靶问题。通过在不同MNMT场景和模型上精心设计实验,我们将脱靶问题归因于(非中心语言,中心语言)语言映射的捷径过拟合。具体来说,学习到的捷径偏向于MNMT在零样本翻译中错误地将非中心语言翻译成中心语言,而不是预期的非中心语言。对学习动态的分析表明,捷径学习通常发生在模型训练的后期阶段,而多语言预训练加速并加剧了捷径学习。基于这些观察,我们提出了一种简单有效的训练策略,通过利用模型训练的遗忘特性来消除MNMT模型中的捷径。与标准训练的唯一区别在于,我们在模型训练的后期阶段移除了可能诱导捷径学习的训练实例。在不引入任何额外数据和计算成本的情况下,我们的方法可以通过缓解不同MNMT模型和基准测试中的捷径学习,持续且显著地提升零样本翻译性能。
引用
@article{arxiv.2411.10581,
title = {On the Shortcut Learning in Multilingual Neural Machine Translation},
author = {Wenxuan Wang and Wenxiang Jiao and Jen-tse Huang and Zhaopeng Tu and Michael R. Lyu},
journal= {arXiv preprint arXiv:2411.10581},
year = {2024}
}
备注
Accepted by Neurocomputing 2024