中文

使用TX-Ray理解与分析多语言神经机器翻译中的模型鲁棒性和知识迁移

计算与语言 2024-12-19 v1 人工智能

摘要

与传统的基于短语的方法相比,神经网络在神经机器翻译(NMT)方面取得了显著进展。然而,在极低资源场景下的多语言神经机器翻译(MNMT)仍未充分探索。本研究调查了跨语言知识迁移如何在极低资源场景下增强MNMT。使用赫尔辛基NLP的Tatoeba翻译挑战数据集,我们进行英语-德语、英语-法语和英语-西班牙语翻译,利用最小并行数据建立跨语言映射。与依赖特定语言对大量预训练的传统方法不同,我们在英语-英语翻译上预训练模型,将所有任务设置英语为源语言。模型使用联合多任务和顺序迁移学习策略在目标语言对上进行微调。我们的工作解决了三个关键问题:(1)跨语言知识迁移如何在极低资源场景下改进MNMT?(2)剪枝神经元知识如何影响模型泛化、鲁棒性和灾难性遗忘?(3)TX-Ray如何解释和量化训练模型中的知识迁移?使用BLEU-4分数的评估表明,顺序迁移学习在40k并行句子语料库上优于基线,展示了其有效性。然而,剪枝神经元知识会降低性能,增加灾难性遗忘,且未能提高鲁棒性或泛化能力。我们的发现为极低资源场景下MNMT中知识迁移和剪枝的潜力和局限性提供了宝贵见解。

关键词

引用

@article{arxiv.2412.13881,
  title  = {Understanding and Analyzing Model Robustness and Knowledge-Transfer in Multilingual Neural Machine Translation using TX-Ray},
  author = {Vageesh Saxena and Sharid Loáiciga and Nils Rethmeier},
  journal= {arXiv preprint arXiv:2412.13881},
  year   = {2024}
}

备注

103 pages, Master's thesis