中文

面向内存与推理约束的混合专家语言模型原则化设计

计算与语言 2026-01-14 v1 机器学习

摘要

现代混合专家(MoE)语言模型的设计基于总参数量(内存占用)和激活参数量(推理成本)。然而,我们发现这两个因素alone insufficient to 描述最优架构。通过系统化研究,我们展示了 MoE 性能主要由总参数量(NtotalN_{total})和专家稀疏度(s:=nexp/ntopks:=n_{exp}/n_{topk})决定。此外,nexpn_{exp}ntopkn_{topk} 并非“抵消”;相反,更大的专家总数会因为满足内存约束而迫使核心模型维度(深度和宽度)降低,从而轻微惩罚性能。由此我们提出一个简单原则:在给定约束下,最大化 NtotalN_{total},同时最小化 ss(即最大化 ntopkn_{topk})和 nexpn_{exp}。我们的发现为解决 MoE 架构的模糊性并指导其设计提供了稳健框架。

关键词

引用

@article{arxiv.2601.08215,
  title  = {Towards Principled Design of Mixture-of-Experts Language Models under Memory and Inference Constraints},
  author = {Seng Pei Liew and Kenta Shinzato and Yuyang Dong},
  journal= {arXiv preprint arXiv:2601.08215},
  year   = {2026}
}

备注

10 pages, 5 figures