中文

什么被激活:揭示MoE语言模型中的领域专家和驱动专家

计算与语言 2026-01-21 v2

摘要

大多数可解释性工作聚焦于Transformer中的层或神经元级机制,导致MoE大语言模型中专家级行为的研究尚不充分。受人类大脑功能专门化的启发,我们通过区分领域专家和驱动专家来分析专家激活。在本工作中,我们研究了三个公共领域中MoE模型的专家激活,并解决了两个关键问题:(1) 哪些专家被激活,以及某些专家类型是否表现出一致的激活模式;(2) 词元如何与特定专家的激活相关联并触发其激活。为了回答这些问题,我们引入了基于熵和因果效应的度量,以评估某个专家是否强烈倾向于特定领域,以及专家激活对模型输出的因果贡献强度,从而分别识别领域专家和驱动专家。此外,我们探索了单个词元如何与特定专家的激活相关联。我们的分析揭示:(1) 在被激活的专家中,一些表现出明确的领域偏好,而另一些则对模型性能产生强烈的因果影响,突显了它们的关键作用。(2) 句子中出现较早的词元更有可能触发驱动专家。(3) 调整领域专家和驱动专家的权重在所有三个模型和领域中都带来了显著的性能提升。这些发现揭示了MoE模型的内部机制并增强了其可解释性。

关键词

引用

@article{arxiv.2601.10159,
  title  = {What Gets Activated: Uncovering Domain and Driver Experts in MoE Language Models},
  author = {Guimin Hu and Meng Li and Qiwei Peng and Lijie Hu and Boyan Xu and Ruichu Cai},
  journal= {arXiv preprint arXiv:2601.10159},
  year   = {2026}
}