中文

稀疏升级复用:从稠密检查点训练专家混合模型

机器学习 2023-02-20 v2 计算与语言 计算机视觉与模式识别

摘要

将大型深度神经网络训练至收敛可能极其昂贵。因此,通常只有少数流行的稠密模型在不同语境与任务中被复用。日益增多的稀疏激活模型试图将模型规模与计算成本解耦,正成为稠密模型的一种有吸引力的替代方案。尽管在质量与计算成本上更为高效,稀疏模型在大规模 regime 下仍十分耗费数据,且从头训练成本高昂。在这项工作中,我们提出稀疏升级复用(sparse upcycling)——一种通过从稠密检查点初始化稀疏激活的专家混合(Mixture-of-Experts)模型来复用已投入训练成本的简单方法。我们表明,分别由稠密检查点升级复用的 T5 Base、Large 与 XL 语言模型以及 Vision Transformer Base 与 Large 模型,仅使用约 50% 的初始稠密预训练沉没成本,便在 SuperGLUE 与 ImageNet 上显著优于其稠密对应模型。这些升级复用模型也优于在 100% 初始稠密预训练计算预算下从头训练的稀疏模型。

关键词

引用

@article{arxiv.2212.05055,
  title  = {Sparse Upcycling: Training Mixture-of-Experts from Dense Checkpoints},
  author = {Aran Komatsuzaki and Joan Puigcerver and James Lee-Thorp and Carlos Riquelme Ruiz and Basil Mustafa and Joshua Ainslie and Yi Tay and Mostafa Dehghani and Neil Houlsby},
  journal= {arXiv preprint arXiv:2212.05055},
  year   = {2023}
}