重访单门控混合专家模型
计算机视觉与模式识别
2023-04-13 v1 机器学习
摘要
混合专家(MoE)作为训练极大规模模型同时推理时保持合理计算成本的手段正日益流行。近期最先进的方法通常假设大量专家,并需联合训练所有专家,这常导致如路由器崩溃等训练不稳定性。相比之下,本工作提出重访简单的单门控 MoE,其允许更实用的训练。我们工作的关键在于:(i)一个既作为早退出又作为集成正则化方案的基础模型分支;(ii)一个简单高效的无需担忧路由器崩溃问题的异步训练流水线;以及(iii)一种基于每样本聚类的初始化。我们通过实验表明,所提模型获得了与其他更复杂 MoE 相当的效率和精度权衡,并优于非混合基线。这展示了即便简单的单门控 MoE 的优势,并激励该领域的进一步探索。
引用
@article{arxiv.2304.05497,
title = {Revisiting Single-gated Mixtures of Experts},
author = {Amelie Royer and Ilia Karmanov and Andrii Skliar and Babak Ehteshami Bejnordi and Tijmen Blankevoort},
journal= {arXiv preprint arXiv:2304.05497},
year = {2023}
}
备注
BMVC 2022