中文

CULL-MT:基于结构层剪枝和语言选择的机器翻译压缩

计算与语言 2024-11-12 v1

摘要

多语言机器翻译模型通常凭借 translation knowledge transfer 超越传统双语模型。近期进展导致这些模型支持数百种语言,实现各种翻译方向的 state-of-the-art 结果。然而,随着模型规模增大,推理操作日益昂贵。在许多用例中,无需支持如此广泛的语言对,因为 translation 通常只需要少数几个选定方向。本文提出 CULL-MT,这是一种基于结构层剪枝和所选语言方向的机器翻译模型压缩方法。我们的 approach 通过贪心策略识别并剪枝不重要的层,然后通过从原始模型进行 knowledge distillation 以及参数高效 fine-tuning 来减轻影响。我们将 CULL-MT 应用于 NLLB-3.3B 和 LLaMA3.1-8B-Instruct 模型。在多向翻译场景(波斯语、法语和德语到英语)中,我们发现 NLLB-3.3B 模型稳健,可剪枝 25% 的层仅导致 0.9 spBLEU 下降。然而,LLaMA3.1-8B-Instruct 更为敏感,剪枝 5 层后出现 2.0 spBLEU 下降。

关键词

引用

@article{arxiv.2411.06506,
  title  = {CULL-MT: Compression Using Language and Layer pruning for Machine Translation},
  author = {Pedram Rostami and Mohammad Javad Dousti},
  journal= {arXiv preprint arXiv:2411.06506},
  year   = {2024}
}