中文

专家竞赛:一种基于混合专家扩展扩散 Transformer 的灵活路由策略

计算机视觉与模式识别 2025-06-13 v3 人工智能 机器学习

摘要

扩散模型已成为视觉生成的主流框架。在此成功基础上,混合专家方法的集成在增强模型可扩展性和性能方面展现出潜力。本文提出 Race-DiT,一种用于扩散 Transformer 的新型 MoE 模型,采用灵活的路由策略“专家竞赛”。通过允许 token 和专家共同竞争并选择最优候选者,模型学习将专家动态分配给关键 token。此外,我们提出逐层正则化以解决浅层学习中的挑战,并引入路由器相似性损失以防止模式崩溃,从而确保更好的专家利用率。在 ImageNet 上的大量实验验证了我们方法的有效性,展示了显著的性能提升以及良好的扩展特性。

关键词

引用

@article{arxiv.2503.16057,
  title  = {Expert Race: A Flexible Routing Strategy for Scaling Diffusion Transformer with Mixture of Experts},
  author = {Yike Yuan and Ziyu Wang and Zihao Huang and Defa Zhu and Xun Zhou and Jingyi Yu and Qiyang Min},
  journal= {arXiv preprint arXiv:2503.16057},
  year   = {2025}
}