中文

迈向多语言机器翻译中更高的帕累托前沿

计算与语言 2023-05-26 v1

摘要

多语言神经机器翻译近年来取得了显著进展。然而,多语言语料库的长尾分布带来了帕累托优化的挑战,即优化某些语言可能以牺牲其他语言性能为代价。现有的平衡训练策略等价于一系列帕累托最优解,它们在帕累托前沿上进行权衡。在本文中,我们提出了一种新的训练框架——帕累托互蒸馏(Pareto Mutual Distillation, Pareto-MD),旨在将帕累托前沿向外推而非进行权衡。具体而言,Pareto-MD 协作训练两个偏向不同语言的帕累托最优解,并允许它们通过知识蒸馏相互学习对方的优势。此外,我们引入了一种新策略,以增强帕累托最优解之间的通信并拓宽我们方法的适用性。在广泛使用的 WMT 和 TED 数据集上的实验结果表明,我们的方法显著推动了帕累托前沿,并以最高 +2.46 BLEU 的优势超越基线。

关键词

引用

@article{arxiv.2305.15718,
  title  = {Towards Higher Pareto Frontier in Multilingual Machine Translation},
  author = {Yichong Huang and Xiaocheng Feng and Xinwei Geng and Baohang Li and Bing Qin},
  journal= {arXiv preprint arXiv:2305.15718},
  year   = {2023}
}

备注

Accepted by ACL2023