大语言模型中的混合专家模型综述
机器学习
2025-04-10 v3 计算与语言
摘要
大语言模型(LLMs)在从自然语言处理到计算机视觉等各个领域都取得了前所未有的进展。LLMs的强大能力源于其庞大的模型规模、广泛多样的数据集以及在训练过程中利用的巨大计算能力,所有这些都促成了LLMs涌现出的能力(例如,上下文学习),而这些能力在小模型中并不存在。在此背景下,混合专家模型(MoE)已成为一种有效方法,能以最小的计算开销大幅扩展模型容量,从而获得了学术界和工业界的广泛关注。尽管其日益普及,但目前仍缺乏对MoE文献的系统性和全面性综述。本综述旨在弥合这一差距,为研究人员深入研究MoE的复杂性提供重要资源。我们首先简要介绍MoE层的结构,然后提出一个新的MoE分类法。接下来,我们概述了各种MoE模型的核心设计,包括算法和系统方面,以及可用的开源实现、超参数配置和实证评估的集合。此外,我们描述了MoE在实践中的多方面应用,并概述了未来研究的一些潜在方向。为促进MoE研究的持续更新和前沿进展的分享,我们在https://github.com/withinmiaov/A-Survey-on-Mixture-of-Experts-in-LLMs 建立了一个资源仓库。
引用
@article{arxiv.2407.06204,
title = {A Survey on Mixture of Experts in Large Language Models},
author = {Weilin Cai and Juyong Jiang and Fan Wang and Jing Tang and Sunghun Kim and Jiayi Huang},
journal= {arXiv preprint arXiv:2407.06204},
year = {2025}
}
备注
The first three authors contributed equally to this work; Accepted by TKDE