图像分类中的 Mixture of Experts:最佳激活点是什么?
计算机视觉与模式识别
2025-10-27 v2 机器学习
摘要
Mixture-of-Experts (MoE) 模型在多个领域显示出具有参数高效扩缩�潜力的前景。然而,其在图像分类中的应用仍有限,往往需要千亿级数据集才能保持竞争力。在本工作中,我们探索将 MoE 层集成到图像分类架构中并使用开放数据集的做法。我们对不同 MoE 配置和模型规模进行系统分析。我们发现,适度的每个样本参数激活量在性能和效率之间提供了最佳权衡。然而,随着激活参数数量的增加,MoE 的优势会逐渐减弱。我们的分析得出几项实用见解用于视觉 MoE 设计。首先,MoE 层最有效地强化微型和中等规模模型,而对大容量网络的收益则趋于饱和,无法实现 ImageNet 性能的突破。其次,Last-2 位置启发式方法为最稳健的跨架构选择,Every-2 对 Vision Transform (ViT) 稍好,且在数据和模型规模增加时仍保持有效。第三,更大数据集(如 ImageNet-21k)允许 ConvNeXt 使用最多 16 个专家而无需更改位置,因为数据增加可减少过拟合并促进更广泛的专家专业化。最后,简单线性路由器效果最佳,表明额外的路由复杂度并不 consistently (持续) 带来益处。
引用
@article{arxiv.2411.18322,
title = {Mixture of Experts in Image Classification: What's the Sweet Spot?},
author = {Mathurin Videau and Alessandro Leite and Marc Schoenauer and Olivier Teytaud},
journal= {arXiv preprint arXiv:2411.18322},
year = {2025}
}
备注
Published in Transactions on Machine Learning Research