通过聚类感知的升级提升混合专家模型的专业化
计算机视觉与模式识别
2026-04-20 v2
摘要
稀疏升级(Sparse Upcycling)提供了一种从预训练稠密权重初始化混合专家(MoE)模型的高效方式,避免了从零训练。然而,由于所有专家均从相同的权重初始化,且路由器随机初始化,模型会受益于专家对称性并在早期受限于专业化。我们提出一种聚类感知升级(Cluster-aware Upcycling)策略,将语义结构纳入MoE初始化。该方法首先将稠密模型的输入激活划分为语义聚类。随后,每个专家通过其对应聚类的子空间表示进行初始化,而路由器的初始权重设置为聚类质心。这种聚类感知的初始化打破了专家对称性,并鼓励与数据分布一致的早期专业化。此外,我们引入一种专家-集合自蒸馏损失,通过使用集合教师提供可靠的路由指导来稳定训练。实验表明,在CLIP ViT-B/32和ViT-B/16上,Cluster-aware Upcycling在零样本和少样本基准测试中 consistently 优于现有方法。该方法还产生更具多样性和解耦的专家表示,降低专家间相似性,并实现更自信的路由行为。项目页面: https://sanghyeokchu.github.io/cluster-aware-upcycling/
引用
@article{arxiv.2604.13508,
title = {Enhancing Mixture-of-Experts Specialization via Cluster-Aware Upcycling},
author = {Sanghyeok Chu and Pyunghwan Ahn and Gwangmo Song and SeungHwan Kim and Honglak Lee and Bohyung Han},
journal= {arXiv preprint arXiv:2604.13508},
year = {2026}
}
备注
Accepted to CVPR 2026