基于 Nadaraya-Watson 核理解混合专家模型
计算与语言
2025-10-15 v2
摘要
混合专家模型已成为近期最先进的大型语言模型的基石。传统上,MoE 依赖 作为路由器评分函数来聚合专家输出,这一设计选择从最早的 MoE 模型一直延续到现代 LLM,如今被广泛视为标准做法。然而,使用 将路由器权重投影到概率单纯形上的必要性一直是一个未受质疑的假设,而非有原则的设计选择。在本工作中,我们首先重新审视经典的 Nadaraya-Watson 回归,并观察到 MoE 与 Nadaraya-Watson 回归具有相同的数学表述。此外,我们表明前馈神经网络(FFN)和 MoE 都可以解释为 Nadaraya-Watson 回归的特例,其中核函数对应于输出层的输入神经元。受这些见解的启发,我们提出了零额外成本的核启发归一化路由器(Kernel Inspired Router with Normalization, KERN),一种 FFN 风格的路由器函数,作为 的替代方案。我们证明该路由器泛化了基于 和 的路由器。基于实证观察和 FFN 实现中的既定实践,我们推荐在 KERN 路由器函数中使用 激活和 -归一化。在 MoE 和 LLM 中的综合实验验证了所提出的 FFN 风格路由器函数的有效性。
引用
@article{arxiv.2509.25913,
title = {Understanding the Mixture-of-Experts with Nadaraya-Watson Kernel},
author = {Chuanyang Zheng and Jiankai Sun and Yihang Gao and Enze Xie and Yuehao Wang and Peihao Wang and Ting Xu and Matthew Chang and Liliang Ren and Jingyao Li and Jing Xiong and Kashif Rasul and Mac Schwager and Anderson Schneider and Zhangyang Wang and Yuriy Nevmyvaka},
journal= {arXiv preprint arXiv:2509.25913},
year = {2025}
}
备注
Tech Report