CartesianMoE: 通过笛卡尔积路由提升 Mixture-of-Experts 模型中专家知识共享
机器学习
2025-02-19 v3 计算与语言
摘要
大型语言模型(LLM)最近因在各类下游任务中的卓越性能而受到社区广泛关注。依据著名的规模定律,扩大稠密 LLM 的能力,但也显著增加计算复杂度。Mixture-of-Experts(MoE)模型通过允许模型规模增长而不显著提高训练或推理成本来解决此问题。然而,MoE 模型面临专家之间知识共享的挑战,导致其性能对路由精度较为敏感。为此,先前工作引入了共享专家,并以“相加”方式将其输出与顶部 个路由专家的输出相结合。本文灵感来自矩阵分解以学习数据之间共享知识的做法,我们提出了 CartesianMoE,通过更类似“相乘”的方式在专家之间实现更有效的知识共享。大量实验结果表明,CartesianMoE 在构建 LLM 方面优于以往的 MoE 模型,尤其在困惑度和下游任务性能方面均表现出佳绩。我们还发现,CartesianMoE 实现了更好的专家路由鲁棒性。
引用
@article{arxiv.2410.16077,
title = {CartesianMoE: Boosting Knowledge Sharing among Experts via Cartesian Product Routing in Mixture-of-Experts},
author = {Zhenpeng Su and Xing Wu and Zijia Lin and Yizhe Xiong and Minxuan Lv and Guangyuan Ma and Hui Chen and Songlin Hu and Guiguang Ding},
journal= {arXiv preprint arXiv:2410.16077},
year = {2025}
}
备注
NAACL2025 Main