中文

路由器学习专家的几何:稀疏混合专家中的几何耦合

机器学习 2026-05-13 v1 计算与语言

摘要

稀疏混合专家 (SMoE) 模型使语言模型的规模化效率提升,但训练仍具有挑战性,因为路由可能在少数专家上坍缩,辅助负载平衡损失会降低专业化。受这些障碍的启发,我们研究 SMoE 中路由决策的形成机制。首先,我们揭示了路由器及其对应专家之间的几何耦合。对于给定的 token,选中专家的路由权重与处理该 token 的专家权重沿相同输入方向接收梯度,仅在标量系数上有所不同。因此,匹配的路由器-专家方向会累积相同的路由 token 历史。这种理论耦合也在路由动力学中得到经验验证。在一个训练自初学的 1B 参数 SMoE 中,更高的路由得分预测更强的专家神经元激活,表明路由决策在所选专家内部得到镜像。接下来,我们分析了辅助负载平衡对路由器-专家几何耦合的影响,表明此类损失通过在路由权重上扩散输入导向梯度,破坏了该结构,使得不同路由器方向彼此之间 nearly 相近三倍。最后,我们演示了几何耦合对于有效路由的重要性,采用一种无参数的在线 K-Means 路由器,其中每个专家维护其接收到的隐藏状态的运行平均值,token 根据余弦相似度分配。与辅助损失和无损失平衡相比,此路由器在保持适度困惑率的同时实现了最低的负载不平衡,表明几何耦合捕获了路由器学习的相当大部分内容。总体而言,我们的结果解释了路由器如何形成支持有效分工的分配几何。

关键词

引用

@article{arxiv.2605.12476,
  title  = {Routers Learn the Geometry of Their Experts: Geometric Coupling in Sparse Mixture-of-Experts},
  author = {Sagi Ahrac and Noya Hochwald and Mor Geva},
  journal= {arXiv preprint arXiv:2605.12476},
  year   = {2026}
}