中文

Mixture-of-Experts 中最优专家注意力分配:一种面向动态模型设计的可扩展比例律

机器学习 2026-03-12 v1 人工智能

摘要

本文提出了神经比例律的一个新扩展,聚焦于 Mixture-of-Experts (MoE) 模型中专家与注意力子层之间的计算分配比例。随着 MoE 架构成为在不按比例增加计算的情况下扩大模型容量的高效方法,确定最优的专家-注意力计算比例变得至关重要。我们定义比例 rr 为专家层相对于注意力层每 token 总 FLOPs 的比例,并探讨该比例如何与总计算预算和模型稀疏性相互作用。通过对 GPT 风格 MoE Transformer 进行大量实验,我们经验发现最优比例 rr^* 与总计算量呈幂律关系,并随稀疏性而变化。我们的分析得出 rr^* 的显式公式,实现对专家-注意力计算分配的精确控制。我们将 Chinchilla 比例律推广到包含此架构参数的情形,为调优 MoE 模型提供新框架,超越仅考虑模型大小和数据。我们的发现为设计高效 MoE 模型提供了实用指南,在遵守固定计算预算的同时实现性能优化。

关键词

引用

@article{arxiv.2603.10379,
  title  = {Optimal Expert-Attention Allocation in Mixture-of-Experts: A Scalable Law for Dynamic Model Design},
  author = {Junzhuo Li and Peijie Jiang and Changxin Tian and Jia Liu and Zhiqiang Zhang and Xuming Hu},
  journal= {arXiv preprint arXiv:2603.10379},
  year   = {2026}
}