中文

ViMoE:设计视觉混合专家的实证研究

计算机视觉与模式识别 2024-11-27 v2

摘要

混合专家(MoE)模型体现了划分-征服的概念,是增加模型容量、在多个领域 demonstrating excellent scalability 的有前景的方法之一。在本文中,我们将MoE结构集成到经典视觉Transformer(ViT)中,命名为ViMoE,并通过针对图像分类和语义分割的全面研究探索将MoE应用于视觉的潜力。然而,我们注意到性能对MoE层的配置敏感,这使得在不经过仔细设计的情况下获得最佳结果具有挑战性。其根本原因是不合适的MoE层导致路由不可靠,并阻碍专家有效获取有帮助的信息。为此,我们引入一个共享专家来学习和捕获常见知识,作为构建稳定ViMoE的有效方法。此外,我们展示了如何分析专家路由行为,揭示哪些MoE层能够专门处理特定信息,而哪些则不能。这为在不牺牲准确性的前提下保留关键层同时消除冗余,推动ViMoE更高效地发展提供了指导。我们期望本工作为视觉MoE模型的设计提供新的见解,并为未来研究提供有价值的实证指导。

关键词

引用

@article{arxiv.2410.15732,
  title  = {ViMoE: An Empirical Study of Designing Vision Mixture-of-Experts},
  author = {Xumeng Han and Longhui Wei and Zhiyang Dou and Zipeng Wang and Chenhui Qiang and Xin He and Yingfei Sun and Zhenjun Han and Qi Tian},
  journal= {arXiv preprint arXiv:2410.15732},
  year   = {2024}
}