内存高效的 NLLB-200:大规模多语言机器翻译模型的语种特定专家剪枝
计算与语言
2023-07-10 v3 人工智能
机器学习
摘要
最近发布的 NLLB-200 是一组覆盖 202 种语言的多语言神经机器翻译模型。最大的模型基于混合专家架构,并在许多语言对上取得了 SOTA 结果。它包含 545 亿参数,仅推理就需要至少四块 32GB GPU。在这项工作中,我们提出一种剪枝方法,能够在无需进一步微调且翻译质量损失可忽略的情况下移除多达 80% 的专家,这使得在单个 32GB GPU 上运行该模型成为可能。进一步分析表明,我们的剪枝指标可以识别语种特定的专家。
引用
@article{arxiv.2212.09811,
title = {Memory-efficient NLLB-200: Language-specific Expert Pruning of a Massively Multilingual Machine Translation Model},
author = {Yeskendir Koishekenov and Alexandre Berard and Vassilina Nikoulina},
journal= {arXiv preprint arXiv:2212.09811},
year = {2023}
}