中文

用于稀疏视觉混合专家模型的教师引导路由

计算机视觉与模式识别 2026-04-24 v1

摘要

深度学习的最新进展是由日益大规模的模型推动的,但由此产生的计算成本已成为一个关键瓶颈。稀疏混合专家模型(MoE)通过仅为每个输入激活一小部分专家,提供了一种有效的解决方案,在不牺牲推理速度的情况下实现了高可扩展性。尽管有效,但稀疏MoE训练表现出特有的优化困难。由于路由器仅通过前向传播中选择的专家接收信息性梯度,它会遭受梯度阻塞,并从未选中的路由中获得很少信息。这种有限的、高度局部化的反馈使得路由器难以学习适当的专家选择分数,并且常常导致不稳定的路由动态,例如训练期间专家分配的波动。为了解决这个问题,我们提出了TGR-MoE:用于稀疏视觉混合专家模型的教师引导路由,这是一种简单而有效的方法,它利用从预训练的密集教师模型获得的监督来稳定路由器学习。TGR-MoE从教师的中间表示构建一个教师路由器,并将其路由输出用作学生路由器的伪监督,抑制训练期间频繁的路由波动,并从训练早期实现知识引导的专家选择。在ImageNet-1K和CIFAR-100上的大量实验表明,TGR始终提高了准确性和路由一致性,同时即使在高度稀疏的配置下也能保持稳定的训练。

关键词

引用

@article{arxiv.2604.21330,
  title  = {Teacher-Guided Routing for Sparse Vision Mixture-of-Experts},
  author = {Masahiro Kada and Ryota Yoshihashi and Satoshi Ikehata and Rei Kawakami and Ikuro Sato},
  journal= {arXiv preprint arXiv:2604.21330},
  year   = {2026}
}