Mix-MoE:通过混合稀疏注意力模块提升大语言模型的多语言机器翻译
计算与语言
2026-05-26 v1 人工智能
摘要
大型语言模型 (LLM) 在多语言机器翻译 (MT) 中展现出巨大潜力,尽管仅凭有限的双语监督数据。然而,使用平行语料微调 LLM 面临主要挑战,即参数干扰。为此,我们提出 Mix-MoE,一种用于多语言 MT 的混合 Mixture-of-Experts 框架。该框架在两个 distinct 阶段运行:(1) 基于单语语料的预训练后使用 MoE,(2) 基于平行语料的预训练后使用 MoE。关键在于将 MoE 层分为两组专门的专家:语言模型专家 (LM Experts) 和机器翻译专家 (MT Experts)。LM Experts 旨在捕获并保留预训练 LLM 所学的单语知识,MT Experts 则专为获取和存储双语翻译知识而设计。此外,为促进这些专门专家之间的有效交互并利用潜在文本结构模式,我们引入一种通过模型表示的傅里叶变换特征增强的路由机制。实验结果表明,Mix-MoE 在多语言 MT 任务中表现卓越,显著优于现有基线,并在减轻参数干扰方面取得显著进步。
引用
@article{arxiv.2605.24681,
title = {Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs},
author = {Bo Li and Tianyu Dong and Shaolin Zhu and Deyi Xiong},
journal= {arXiv preprint arXiv:2605.24681},
year = {2026}
}
备注
Accepted by TASLP