理解混合专家大语言模型中的多语言能力:路由机制、专家专业化和逐层引导
计算与语言
2026-01-21 v1
摘要
混合专家(MoE)架构已展现出强大的多语言能力,然而,其性能提升和跨语言差异背后的内部机制仍未得到充分理解。在这项工作中,我们对混合专家模型进行了系统分析,考察了跨语言和网络深度的路由行为和专家专业化。我们的分析揭示,混合专家模型中的多语言处理是高度结构化的:路由与语言家族对齐,专家利用遵循清晰的逐层模式,高资源语言依赖共享专家,而低资源语言尽管性能较弱,却更依赖于语言专属专家。逐层干预进一步表明,早期和晚期的混合专家层支持语言特定处理,而中间层则充当语言无关的能力枢纽。基于这些见解,我们提出了一种路由引导的引导方法,该方法在推理时自适应地将中间层的路由行为引导向与主导语言相关的共享专家,从而带来一致的多语言性能提升,特别是对于语言相关的语言对。我们的代码可在https://github.com/conctsai/Multilingualism-in-Mixture-of-Experts-LLMs获取。
引用
@article{arxiv.2601.14050,
title = {Understanding Multilingualism in Mixture-of-Experts LLMs: Routing Mechanism, Expert Specialization, and Layerwise Steering},
author = {Yuxin Chen and Zhengzhou Cai and Xiangtian Ji and Weixiang Zhao and An Zhang and Xiang Wang and Tat-Seng Chua},
journal= {arXiv preprint arXiv:2601.14050},
year = {2026}
}