移动V-MoEs:通过稀疏混合专家缩放缩小视觉Transformer
计算机视觉与模式识别
2023-09-11 v1 机器学习
机器学习
摘要
稀疏混合专家模型(MoEs)近年来广受欢迎,因为它们能够通过仅为任意给定输入词元激活一小部分模型参数,将模型规模与推理效率解耦。因此,稀疏MoEs实现了前所未有的可扩展性,在自然语言处理和计算机视觉等领域取得了巨大成功。在本工作中,我们转而探索使用稀疏MoEs来缩小视觉Transformer(ViTs)的规模,使其在资源受限的视觉应用中更具吸引力。为此,我们提出了一种简化且移动友好的MoE设计,其中将整幅图像而非单个图像块路由至专家。我们还提出了一种稳定的MoE训练流程,利用超类信息引导路由器。我们通过实证表明,我们的稀疏移动视觉MoEs(V-MoEs)能比相应的稠密ViTs实现更好的性能与效率权衡。例如,对于ViT-Tiny模型,我们的移动V-MoE在ImageNet-1k上比其稠密对应模型高出3.39%。对于推理代价仅54M FLOPs的更小ViT变体,我们的MoE实现了4.66%的提升。
引用
@article{arxiv.2309.04354,
title = {Mobile V-MoEs: Scaling Down Vision Transformers via Sparse Mixture-of-Experts},
author = {Erik Daxberger and Floris Weers and Bowen Zhang and Tom Gunter and Ruoming Pang and Marcin Eichner and Michael Emmersberger and Yinfei Yang and Alexander Toshev and Xianzhi Du},
journal= {arXiv preprint arXiv:2309.04354},
year = {2023}
}