中文

混合专家模型综述:算法、理论与应用

机器学习 2026-01-27 v4 人工智能

摘要

人工智能(AI)在许多领域取得了惊人的成功,尤其是随着基础大模型发展的最新突破。这些大模型利用其海量训练数据,为各种下游任务提供通用解决方案。然而,随着现代数据集日益多样化和复杂化,大型 AI 模型的发展面临两大主要挑战:(1)计算资源的巨大消耗与部署困难,以及(2)难以拟合异构和复杂数据,这限制了模型的可用性。混合专家模型最近在应对这些挑战方面引起了广泛关注,它通过动态选择并激活最相关的子模型来处理输入数据。研究表明,MoE 能够以更少的资源显著提升模型性能和效率,尤其擅长处理大规模、多模态数据。鉴于 MoE 在各个领域展现出的巨大潜力,亟需对其在许多重要领域的最新进展进行全面总结。现有的 MoE 综述存在局限性,例如内容过时或缺乏对某些关键领域的讨论,我们旨在弥补这些空白。在本文中,我们首先介绍 MoE 的基本设计,包括门控函数、专家网络、路由机制、训练策略和系统设计。然后,我们探讨 MoE 在持续学习、元学习、多任务学习和强化学习等重要机器学习范式中的算法设计。此外,我们总结了旨在理解 MoE 的理论研究,并回顾了其在计算机视觉和自然语言处理中的应用。最后,我们讨论了未来有前景的研究方向。

关键词

引用

@article{arxiv.2503.07137,
  title  = {A Comprehensive Survey of Mixture-of-Experts: Algorithms, Theory, and Applications},
  author = {Siyuan Mu and Sen Lin},
  journal= {arXiv preprint arXiv:2503.07137},
  year   = {2026}
}

备注

29 pages, 3 figures