MoE Jetpack:从稠密检查点到面向视觉任务的自适应混合专家
计算机视觉与模式识别
2024-06-10 v1
摘要
稀疏激活的混合专家(MoE)模型作为传统稠密激活(dense)模型的有前景的替代方案,既提升了质量,又增强了计算效率。然而,从头训练MoE模型需要大量数据和计算资源。此外,公共代码库如timm主要提供预训练的稠密检查点,而缺乏类似的MoE模型资源,阻碍了其采用。为弥合这一差距,我们引入MoE Jetpack,这是一种将稠密检查点微调为MoE模型的有效方法。MoE Jetpack融合了两种关键技术:(1)检查点循环利用,将稠密检查点重新用作MoE模型的初始权重,从而加速收敛、提升精度,并减轻预训练的计算负担;(2)球面自适应MoE(SpheroMoE)层,针对更好地集成稠密检查点,优化MoE架构,提升微调性能。我们在视觉任务上的实验表明,MoE Jetpack在将稠密检查点微调为MoE模型时,显著提高了收敛速度和精度。我们的代码将在https://github.com/Adlith/MoE-Jetpack公开。
引用
@article{arxiv.2406.04801,
title = {MoE Jetpack: From Dense Checkpoints to Adaptive Mixture of Experts for Vision Tasks},
author = {Xingkui Zhu and Yiran Guan and Dingkang Liang and Yuchao Chen and Yuliang Liu and Xiang Bai},
journal= {arXiv preprint arXiv:2406.04801},
year = {2024}
}
备注
9 pages, 6 figures