Dirichlet 先验塑形:引导循环 MoE 中的专家专业化
机器学习
2025-10-02 v1
摘要
将预训练稠密模型循环为稀疏 Mixture-of-Experts(MoE)是一种高效增加模型容量的方法,但常因笨拙的权重复制导致专家专业化差。我们的分析表明,即使使用常规正则化,循环 MoE 也表现出低置信度、弱差异化路由,阻碍性能。我们引入 Dirichlet 先验塑形损失(DPSL),这是一种新的路由正则化技术,直接通过匹配专家分配来塑形路由概率分布。DPSL 提供对专家平衡和专业化的细粒度控制,能够编码诸如鼓励专家聚焦于特定模态或任务的归纳偏置,而无需人工干预;值得注意的是,DPSL 是一种通用工具,可应用于任何输出类别概率分布的模块,扩展了其在 MoE 训练之外的实用性。在循环 MoE 视觉-语言模型(基于 Qwen2、Phi3、Llama3.2 LLM 作为 backbone)上的实验表明,DPSL 在标准视觉-语言基准测试中持续优于循环策略和正则化技术,解决了专家专业化差的问题,促进了更具适应性和更高性能的模型。
关键词
引用
@article{arxiv.2510.01185,
title = {Dirichlet-Prior Shaping: Guiding Expert Specialization in Upcycled MoEs},
author = {Leyla Mirvakhabova and Babak Ehteshami Bejnordi and Gaurav Kumar and Hanxue Liang and Wanru Zhao and Paul Whatmough},
journal= {arXiv preprint arXiv:2510.01185},
year = {2025}
}