面向内存与推理约束的混合专家语言模型原则化设计
计算与语言
2026-01-14 v1 机器学习
摘要
现代混合专家(MoE)语言模型的设计基于总参数量(内存占用)和激活参数量(推理成本)。然而,我们发现这两个因素alone insufficient to 描述最优架构。通过系统化研究,我们展示了 MoE 性能主要由总参数量()和专家稀疏度()决定。此外, 和 并非“抵消”;相反,更大的专家总数会因为满足内存约束而迫使核心模型维度(深度和宽度)降低,从而轻微惩罚性能。由此我们提出一个简单原则:在给定约束下,最大化 ,同时最小化 (即最大化 )和 。我们的发现为解决 MoE 架构的模糊性并指导其设计提供了稳健框架。
引用
@article{arxiv.2601.08215,
title = {Towards Principled Design of Mixture-of-Experts Language Models under Memory and Inference Constraints},
author = {Seng Pei Liew and Kenta Shinzato and Yuyang Dong},
journal= {arXiv preprint arXiv:2601.08215},
year = {2026}
}
备注
10 pages, 5 figures