中文

MoE 透镜 —— 专家就是唯一需要的

机器学习 2026-03-09 v1

摘要

Mixture of Experts (MoE) 模型通过稀疏专家激活实现参数高效扩展,但由于对其专业化行为理解有限,仍面临推理和内存成本优化的挑战。我们提出了两种互补方法的系统性分析,以探究 MoE 中的专家专业化:领域特定路由模式和一种跟踪专家对输出表示贡献的早期解码框架。我们的分析表明,尽管该模型拥有 64 个路由专家且每个层计算仅激活 6 个专家,模型主要依赖少数专业化专家,其中排名第一的专家输出与完整集体预测的近似结果非常接近。我们通过对 token 路由分布进行系统性分析,定量验证了这些发现,表明极少数专家在不同专业化领域的路由决策中占据超过 50% 的比重。单专家与集体专家在每个层的隐藏状态相似度极高,部分层的余弦相似度可达 0.95,而在三个领域中仅使用单个专家时,困惑度仅增加 5%。我们的结果表明,Mixture of Experts 模型 exhibits 专家集中化,这为通过针对性专家剪枝来进行推理优化提供了潜在机遇,同时保持模型性能,并为研究这些模型中学习知识的局部化开辟了研究之路。

关键词

引用

@article{arxiv.2603.05806,
  title  = {MoE Lens -- An Expert Is All You Need},
  author = {Marmik Chaudhari and Idhant Gulati and Nishkal Hundia and Pranav Karra and Shivam Raval},
  journal= {arXiv preprint arXiv:2603.05806},
  year   = {2026}
}

备注

15 pages, 10 figures, ICLR 2025 Workshop on Sparsity in LLMs (SLLM)