中文

SMILE:从预训练基础模型进行零样本稀疏低秩专家混合体构建

机器学习 2024-08-27 v2 人工智能

摘要

在广泛数据集上训练深度模型正日益变得成本高昂,促使广泛采用深度模型融合技术以利用现有模型的知识。从简单的权重平均到更复杂的方法如 AdaMerging,模型融合有效提升了模型性能并加速了新模型的开发。然而,单个模型参数之间的潜在干扰以及融合过程缺乏可解释性仍然是重大挑战。现有方法通常通过评估参数的属性(如幅度或符号)或通过参数剪枝来尝试解决参数干扰问题。在本研究中,我们从子空间分析的角度审视线性层的微调,并明确将参数干扰定义为优化问题以阐明这一主题。随后,我们提出了一种创新的模型融合方法——零样本稀疏低秩专家混合体(SMILE)构建,允许在不使用额外数据或进一步训练的情况下将源模型扩展为 MoE 模型。我们的方法依赖于以下观察:微调主要保留了预训练中的重要部分,但使用了较不重要或未使用的区域来适应新任务。此外,参数干扰问题在原始参数空间中本质上是不可处理的,但可以通过扩展维度来管理。我们在多样化场景下进行了广泛实验,如图像分类和文本生成任务,使用全微调和 LoRA 微调,并将我们的方法应用于大型语言模型(CLIP 模型、Flan-T5 模型和 Mistral-7B 模型),展示了 SMILE 的适应性和可扩展性。代码可在 https://github.com/tanganke/fusion_bench 获取。

关键词

引用

@article{arxiv.2408.10174,
  title  = {SMILE: Zero-Shot Sparse Mixture of Low-Rank Experts Construction From Pre-Trained Foundation Models},
  author = {Anke Tang and Li Shen and Yong Luo and Shuai Xie and Han Hu and Lefei Zhang and Bo Du and Dacheng Tao},
  journal= {arXiv preprint arXiv:2408.10174},
  year   = {2024}
}

备注

Code is available at https://github.com/tanganke/fusion_bench