中文

稀疏MoE遇见高效集成

机器学习 2023-07-11 v2 计算机视觉与模式识别 机器学习

摘要

基于子模型聚合输出(在激活或预测层面)的机器学习模型,相较于单个模型通常表现出更强的性能。我们研究了两类此类流行模型的交互:神经网络集成与稀疏专家混合(sparse MoEs)。首先,我们表明两种方法具有互补的特性,其结合是有益的。这包括对稀疏MoE在不确定性相关基准上的综合评估。随后,我们提出高效专家集成(E3^3),一种可扩展且简单的稀疏MoE集成,它取两类模型之长,同时使用的FLOPs比深度集成最多少45%。大量实验证明了E3^3在多个具有挑战性的基于视觉Transformer的基线上在准确率、对数似然、少样本学习、鲁棒性和不确定性方面的提升。E3^3不仅在扩展到参数多达2.7B的模型时保持其效率,还为更大的模型提供了更好的预测性能与不确定性估计。

关键词

引用

@article{arxiv.2110.03360,
  title  = {Sparse MoEs meet Efficient Ensembles},
  author = {James Urquhart Allingham and Florian Wenzel and Zelda E Mariet and Basil Mustafa and Joan Puigcerver and Neil Houlsby and Ghassen Jerfel and Vincent Fortuin and Balaji Lakshminarayanan and Jasper Snoek and Dustin Tran and Carlos Riquelme Ruiz and Rodolphe Jenatton},
  journal= {arXiv preprint arXiv:2110.03360},
  year   = {2023}
}

备注

59 pages, 26 figures, 36 tables. Accepted at TMLR