中文

内存高效的 NLLB-200:大规模多语言机器翻译模型的语种特定专家剪枝

计算与语言 2023-07-10 v3 人工智能 机器学习

摘要

最近发布的 NLLB-200 是一组覆盖 202 种语言的多语言神经机器翻译模型。最大的模型基于混合专家架构,并在许多语言对上取得了 SOTA 结果。它包含 545 亿参数,仅推理就需要至少四块 32GB GPU。在这项工作中,我们提出一种剪枝方法,能够在无需进一步微调且翻译质量损失可忽略的情况下移除多达 80% 的专家,这使得在单个 32GB GPU 上运行该模型成为可能。进一步分析表明,我们的剪枝指标可以识别语种特定的专家。

关键词

引用

@article{arxiv.2212.09811,
  title  = {Memory-efficient NLLB-200: Language-specific Expert Pruning of a Massively Multilingual Machine Translation Model},
  author = {Yeskendir Koishekenov and Alexandre Berard and Vassilina Nikoulina},
  journal= {arXiv preprint arXiv:2212.09811},
  year   = {2023}
}