少即是好:基于逐层混合专家的大语言模型高效多语言扩展
计算与语言
2025-05-29 v1
摘要
为现有大语言模型(LLM)持续扩展新语言是构建强大多语言 LLM 的一种有前景但具挑战性的方法。最大的挑战在于使模型持续学习新语言的同时,保持对旧语言的熟练能力。为实现这一目标,近期工作利用混合专家架构通过添加新专家来扩展新语言,并通过将相应的 token 路由至原始模型主干(旧专家)来避免对旧语言的灾难性遗忘。尽管直观,这类方法在扩展新语言时参数成本高昂,且仍不可避免地影响旧语言的性能。为解决这些局限性,我们分析了 LLM 中不同层的语言特性,并提出一种逐层专家分配算法(LayerMoE)来确定每层合适的新专家数量。具体而言,我们发现 LLM 中不同层在语言间表现出不同的表示相似性,随后利用该相似性作为为每层分配专家的指标,即相似性越高,专家越少。此外,为进一步减轻对旧语言的遗忘,我们在具有较高相似性的层上的路由网络前添加一个分类器,以引导旧语言 token 的路由。实验结果表明,在单次扩展设置下,我们的方法以减少 60% 的专家数量优于先前最先进的基线;在终身扩展设置下,以减少 33.3% 的专家数量优于基线,证明了我们方法的有效性。
引用
@article{arxiv.2505.22582,
title = {Less, but Better: Efficient Multilingual Expansion for LLMs via Layer-wise Mixture-of-Experts},
author = {Xue Zhang and Yunlong Liang and Fandong Meng and Songming Zhang and Yufeng Chen and Jinan Xu and Jie Zhou},
journal= {arXiv preprint arXiv:2505.22582},
year = {2025}
}
备注
ACL 2025 (Main), 16 pages, 5 figures, 11 tables