面向负载均衡的Mixture of Experts:保持相似性的路由器
机器学习
2025-10-14 v2
摘要
稀疏Mixture of Experts(MoE)模型通过为每个输入激活仅一小部分参数("专家")的子集,提供了大规模神经网络训练的可扩展且高效架构。学习路由器计算对这些专家的分布,并将输入token分配给小subset。然而,缺乏辅助平衡机制时,路由器常收敛于仅使用少数专家,严重限制模型容量并降低性能。目前大多数负载均衡机制都鼓励专家分布类似于每个token大致均匀分布的专家。在训练期间,这可能导致路由行为不一致,使模型在学习冗余知识方面浪费容量。我们通过引入一种保持token间关系结构的新型负载均衡损失来解决此问题,鼓励在训练期间对相似输入保持一致的专家选择。我们的实验结果表明,将我们的损失应用于路由器后,收敛速度快36%,且冗余性更低。
引用
@article{arxiv.2506.14038,
title = {Load Balancing Mixture of Experts with Similarity Preserving Routers},
author = {Nabil Omi and Siddhartha Sen and Ali Farhadi},
journal= {arXiv preprint arXiv:2506.14038},
year = {2025}
}