中文

自路由:从隐藏状态实现无参数专家路由

人工智能 2026-04-02 v1

摘要

专家混合(MoE)层通过每token仅激活少量专家来增加模型容量,通常依赖学习到的路由器将隐藏状态映射到专家分配。在这项工作中,我们问在我们研究的MoE设置中,专用的学习路由器是否严格必要。我们提出了Self-Routing,一种无参数路由机制,利用token隐藏状态的指定子空间直接作为专家logits,完全消除了路由器投影,同时保持MoE层的其余部分不变。我们在GPT-2规模语言建模和ImageNet-1K分类上评估了Self-Routing,将其与标准学习路由器、随机路由基线和密集非MoE基线进行比较。结果表明,Self-Routing在去除所有专用路由参数的同时仍与学习路由器基线保持竞争力,并且实现了更平衡的专家利用率,平均归一化路由熵提高约17%,且无需显式负载均衡损失。在ImageNet-1K上使用DeiT-S/16时,Self-Routing也略微优于相应的学习路由器MoE。这些发现表明,有效的MoE路由可以从隐藏表征本身中涌现,而无需单独的学路由器模块。

关键词

引用

@article{arxiv.2604.00421,
  title  = {Self-Routing: Parameter-Free Expert Routing from Hidden States},
  author = {Jama Hussein Mohamud and Drew Wagner and Mirco Ravanelli},
  journal= {arXiv preprint arXiv:2604.00421},
  year   = {2026}
}