紧密聚类构成专业化专家
机器学习
2026-04-21 v3
摘要
稀疏混合专家(MoE)架构已成为有效分离模型容量与计算成本的 promising 方法。MoE模型的核心是路由器,它学习输入分布的底层聚类结构,以将输入 token 发送到合适的专家。然而,在高维空间中,潜在聚类可能难以识别,导致收敛缓慢、对数据污染敏感以及整体表示性能下降,因为路由器无法进行恰当的 token-专家匹配。我们通过聚类优化的视角考察路由器,推导最大识别潜在聚类的最优特征权重。我们利用这些权重在适应变换的空间中计算 token-专家路由分配,以促进良好分离的聚类,从而帮助为每个 token 识别最匹配的专家。具体而言,对于每个专家聚类,我们计算一组权重,根据该专家在该特征上是否紧密聚类来缩放特征。我们将这种新型路由器称为自适应聚类(AC)路由器。我们的AC路由器使MoE模型获得三个相互关联的收益:1)更快的收敛速度,2)对数据损坏的更好鲁棒性,3)整体性能提升,因为专家在输入空间的语义上差异化区域中得到专业化。我们在语言建模和图像识别任务上,对各种MoE骨干网络进行实验,包括干净和受污染的设置,展示了AC路由器相对于基线路由方法的优势。
引用
@article{arxiv.2502.15315,
title = {Tight Clusters Make Specialized Experts},
author = {Stefan K. Nielsen and Rachel S. Y. Teo and Laziz U. Abdullaev and Tan M. Nguyen},
journal= {arXiv preprint arXiv:2502.15315},
year = {2026}
}