细粒度专家的力量:粒度提升混合专家模型的表达能力
机器学习
2025-05-13 v1 人工智能
机器学习
摘要
混合专家(Mixture-of-Experts, MoE)层日益成为前沿模型架构的核心组件。通过选择性激活参数,该方法在扩大总参数规模的同时降低计算成本。本文探讨了活跃专家数量——即粒度——对模型表达能力的影响,比较了以大量专家(如 DeepSeek 每层 8 个)和较少专家(如 Llama-4 模型每层 1 个)为主的架构。我们证明了基于这一设计参数的网络表达能力呈指数级分离,表明模型从高粒度中受益。实验结果证实了我们的理论发现,展示了这种分离现象。
引用
@article{arxiv.2505.06839,
title = {The power of fine-grained experts: Granularity boosts expressivity in Mixture of Experts},
author = {Enric Boix-Adsera and Philippe Rigollet},
journal= {arXiv preprint arXiv:2505.06839},
year = {2025}
}