中文

混合神经元专家

计算与语言 2025-10-08 v1

摘要

在本研究中,我们首先探讨 MoE 层激活的参数在推理时是否保持高度稀疏。我们对几个具有代表性的 MoE 模型进行了稀疏化研究。对于每个专家,我们根据其来自门控投影的激活幅度对参数进行排序,并逐步对激活的子集进行剪枝。对该子集中多达 60% 的参数进行剪枝仅导致可忽略不计的任务性能下降;只有在移除超过 90% 的参数后才会出现显著的性能下降。我们进一步将专家分解为神经元粒度的 MoE,并可视化其激活值,发现大多数神经元的激活值接近于零。这一观察促使我们在预训练期间仅选择高激活的神经元专家。基于这一洞察,我们提出了混合神经元专家。MoNE 通过在每个专家内仅应用简单的 top-k 选择来实现神经元粒度的专家选择,其产生的延迟可忽略不计,且不需要额外的路由参数或专家间通信。大量实验表明,MoNE 在仅激活 50% 的 MoE 层参数时即可匹配传统 MoE 的性能,并且在激活参数数量相同的情况下始终优于传统 MoE。这些结果表明,MoNE 是一种提高类 MoE 模型参数利用率和推理效率的实用方法。

关键词

引用

@article{arxiv.2510.05781,
  title  = {Mixture of Neuron Experts},
  author = {Runxi Cheng and Yuchen Guan and Yucheng Ding and Qingguo Hu and Yongxian Wei and Chun Yuan and Yelong Shen and Weizhu Chen and Yeyun Gong},
  journal= {arXiv preprint arXiv:2510.05781},
  year   = {2025}
}

备注

18 page, 11 figures, 7 tables