通向多语言大语言模型的数据高效路径:通过将训练后参数增量集成至升级版MoE实现语言扩展
计算与语言
2026-05-19 v1
摘要
将大语言模型(LLM)扩展至新语言是一项成本高昂的工作,需要大量的持续预训练(CPT)与数据密集的对齐。尽管近期的无数据合并技术试图通过将经过多语言 CPT 增强的模型与其指令模型相融合来绕过对齐,但它们受到一个关键权衡的困扰:缓解参数冲突以保留原有能力不可避免地会削弱新语言的习得,反之亦然。为解决这一冲突,我们引入了 \method,该方法将稠密模型升级为混合专家架构,将不同专家分配给不同语言。随后,通过将 MoE 扩展的参数增量()嫁接到经 CPT 增强的基础模型上,绕过复杂的对齐阶段来转移对齐能力。实验表明,即使与具有相似 FLOPs 或参数量的基线相比,\method 依然表现出优越性;它在提升扩展语言性能的同时,有效保留了原有能力。我们进一步表明,该方法在不同模型和训练后增量上均具有高度适用性。
引用
@article{arxiv.2605.18083,
title = {A Data-Efficient Path to Multilingual LLMs: Language Expansion via Post-training PARAM$\Delta$ Integration into Upcycled MoE},
author = {Hao Zhou and Tianhao Li and Zhijun Wang and Shuaijie She and Linjuan Wu and Hao-Ran Wei and Baosong Yang and Jiajun Chen and Shujian Huang},
journal= {arXiv preprint arXiv:2605.18083},
year = {2026}
}