MultiPL-MoE:基于混合专家模型的大型语言模型多编程语言扩展
计算与语言
2025-09-09 v2 人工智能
摘要
尽管 LLM 在代码创建方面表现优异,但多编程语言代码生成仍然极具挑战性。为此,我们意在在保留最受欢迎语言的同时,使用受限计算资源来提高基础 LLM 的多编程语言(MultiPL)性能。我们将 MultiPL 视为自然语言的特殊情况,提出一种基于混合专家(MoE)的 LLM 扩展方法,称为 MultiPL-MoE。具体而言,MultiPL-MoE 将两个配对的 MoE 组合在一起,在 token 和 segment 两个层面优化专家选择。token 级别的 MoE 是一种标准的 upcycling MoE 结构,包含共享专家和一种新颖的门控权重归一化方法,有助于最终与 segment 级别的 MoE 进行融合。segment 级别的 MoE 包含两种创新设计,以更好地捕捉编程语言的语法结构和上下文模式:首先,使用滑动窗口将输入 token 序列划分为多个 segment;其次,采用专家选择路由策略,允许专家选择 top-k 个 segment。实验结果证明了 MultiPL-MoE 的有效性。
引用
@article{arxiv.2508.19268,
title = {MultiPL-MoE: Multi-Programming-Lingual Extension of Large Language Models through Hybrid Mixture-of-Experts},
author = {Qing Wang and Xue Han and Jiahui Wang and Lehao Xing and Qian Hu and Lianlian Zhang and Chao Deng and Junlan Feng},
journal= {arXiv preprint arXiv:2508.19268},
year = {2025}
}