修复多语言机器翻译中 MoE 在低资源语言上的过拟合
计算与语言
2022-12-19 v1 人工智能
摘要
稀疏门控专家混合(MoE)模型已被证明是一种计算高效的扩展模型容量以用于多语言机器翻译的方法。然而,对于低资源任务,MoE 模型严重过拟合。我们展示了有效的正则化策略,即 EOM 和 FOM 中 MoE 层的 dropout 技术、条件 MoE 路由和课程学习方法,可防止过拟合并在不影响高资源任务的情况下提升 MoE 模型在低资源任务上的性能。在一个大规模多语言机器翻译基准上,我们的策略在极低资源语言对上带来了约 +1 chrF++ 的提升。我们对学到的 MoE 路由进行了广泛分析,以更好地理解我们正则化方法的影响以及我们如何改进它们。
引用
@article{arxiv.2212.07571,
title = {Fixing MoE Over-Fitting on Low-Resource Languages in Multilingual Machine Translation},
author = {Maha Elbayad and Anna Sun and Shruti Bhosale},
journal= {arXiv preprint arXiv:2212.07571},
year = {2022}
}
备注
arXiv admin note: text overlap with arXiv:2207.04672