通过激进修剪专家从 LLM 中提取小型翻译专家
计算与语言
2026-05-28 v1 人工智能
机器学习
摘要
现代大型语言模型(LLM)实现了最先进的机器翻译性能,但它们作为广泛的通用专家,主要训练于与翻译无关的众多任务和能力上。因此,对于该任务而言,它们严重过度参数化,导致内存和计算要求过高。本文提出一种方法,通过激进修剪 LLM 中的专家,同时几乎不损害翻译质量。我们的方法利用专家的专业化以及多语言能力的可分离性来识别与翻译无关的专家。由于 MoE 的模块化特性,这些专家可以轻松地被修剪,而无需任何训练。我们能够在不重新训练的情况下修剪一半以上的专家,几乎不产生质量损失;修剪 70% 的专家仅导致轻微损失。通过非常简短的 SFT,我们可以修剪 75% 的专家 while 恢复基准性能,在某些情况下移除近 90% 的专家 while 保持合理的翻译质量。总体而言,我们的结果表明,翻译只需要 LLM 的一小部分,从而显著压缩包含超过 90% 参数的 MoE 块。
引用
@article{arxiv.2605.28042,
title = {Extracting Small Translation Specialists from LLMs by Aggressively Pruning Experts},
author = {Liu O. Martin and Lucas Bandarkar and Nanyun Peng},
journal= {arXiv preprint arXiv:2605.28042},
year = {2026}
}