评估 MoE LLM 在问答任务中的专家贡献
计算与语言
2025-02-25 v1 人工智能
摘要
近期,带有混合专家层的大语言模型受到了广泛关注。目前,最先进的大语言模型均采用这种架构。关于如何训练此类模型以及如何为该架构选择超参数,已有大量研究。然而,缺乏针对 MoE 层属性的事后评估分析的研究。本文通过评估基于问答的 MMLU 基准上的专家贡献,迈出了填补这一空白的第一步。我们表明,在该基准的推理过程中,大多数专家从未被激活。此外,门控网络的输出分布远接近于均匀分布而非稀疏分布。最后,我们证明了同一层内部分专家的平均性能存在显著差异。
引用
@article{arxiv.2502.17187,
title = {Evaluating Expert Contributions in a MoE LLM for Quiz-Based Tasks},
author = {Andrei Chernov},
journal= {arXiv preprint arXiv:2502.17187},
year = {2025}
}
备注
preprint, short paper