中文

DynaMoE:面向混合专家神经网络的动态 token 级专家激活与层级自适应容量

机器学习 2026-03-03 v1 人工智能

摘要

混合专家(Mixture-of-Experts,MoE)架构已成为在保持计算效率的同时扩展神经网络规模的强大范式。然而,标准的 MoE 实现依赖两个僵化的设计假设:(1)固定 Top-K 路由,即每个 token 恰激活 K 个专家;(2)跨所有层的统一专家分配。本文引入 DynaMoE,一种新颖的 MoE 框架,通过动态 token 级专家激活和层级自适应容量分配,放宽了上述两个限制。DynaMoE 引入了一种原则性的路由机制,根据输入复杂度动态调整每个 token 活活专家的数量。同时,该框架实现了六种不同的调度策略,用于在网络深度上分布专家容量,包括递减、递增、金字塔和波浪模式。我们对动态路由的表达能力提升进行了理论分析,并推导了计算效率的下界。通过在 MNIST、Fashion-MNIST、CIFAR-10(图像分类)和 Recycling-the-web(语言建模)上的大量实验,跨多个模型规模,我们展示 DynaMoE 在参数效率上优于静态基线。我们的关键发现表明,最优专家调度方案取决于任务类型和规模:在图像分类任务中,递减调度(在早期层集中容量)优于统一基线;在语言建模任务中,根据模型大小不同,Tiny 模型采用递减、Small 模型采用递增、Medium 模型采用统一。此外,动态路由可降低训练期间的梯度方差,导致收敛稳定性得到改善。DynaMoE 为神经网络中的自适应计算框架提供了新的框架,为 MoE 架构设计提供原则性指导。

关键词

引用

@article{arxiv.2603.01697,
  title  = {DynaMoE: Dynamic Token-Level Expert Activation with Layer-Wise Adaptive Capacity for Mixture-of-Experts Neural Networks},
  author = {Gökdeniz Gülmez},
  journal= {arXiv preprint arXiv:2603.01697},
  year   = {2026}
}