多语言神经机器翻译的帕累托前沿研究
计算与语言
2023-11-01 v3 人工智能
摘要
本文研究了在多语言神经机器翻译(MNMT)中,给定语向的性能如何随其采样比例变化。通过训练超过200个具有不同模型规模、数据规模和语言方向的 multilingual 模型,我们惊奇地发现,某些翻译方向的性能并不总是随其在多任务优化目标中权重的增加而提升。因此,当训练语料存在数据不平衡时,标量化的方法会导致一个偏离传统帕累托前沿的多任务权衡前沿,这对提升所有方向的整体性能提出了巨大挑战。基于我们的观察,我们提出了双幂律(Double Power Law)来预测 MNMT 中独特的性能权衡前沿,该定律在不同语言、数据充分性以及任务数量下均具有鲁棒性。最后,我们将 MNMT 中的采样比例选择问题形式化为基于双幂律的优化问题。在实验中,该方法仅用 1/5 至 1/2 的总训练预算便取得了优于温度搜索和梯度操纵方法的性能。我们在 https://github.com/pkunlp-icler/ParetoMNMT 发布了代码以供复现。
引用
@article{arxiv.2304.03216,
title = {On the Pareto Front of Multilingual Neural Machine Translation},
author = {Liang Chen and Shuming Ma and Dongdong Zhang and Furu Wei and Baobao Chang},
journal= {arXiv preprint arXiv:2304.03216},
year = {2023}
}
备注
NeurIPS 2023