中文

MoLEx: 用于稀疏升级微调的层专家混合

计算与语言 2025-03-17 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

深度模型的大规模预训练及其后的微调,已成为自然语言处理 (NLP) 的基石。数据的丰富与计算资源的结合催生了具有大量参数的大型模型。虽然这些模型的庞大体积在许多 NLP 任务中带来了显著的成功,但其弊端在于,为适应每个任务或领域而重新训练所有基础模型参数所需的成本高昂。参数高效微调通过在保持模型质量的同时最小化需要微调的参数数量,为这一挑战提供了有效的解决方案。虽然现有方法取得了令人瞩目的成果,但它们主要集中于适配部分参数、权重重参数化和提示工程。在本文中,我们将层视为不同类型语言信息的提取器,这些信息在结合使用时极具价值。随后,我们提出了层专家混合,一种新颖的稀疏混合专家,其专家是预训练模型中的层。它在微调过程中执行层的混合条件计算,为模型提供关于数据的更多结构知识。通过为层间信息交换提供途径,MoLEx 使模型能够对下游任务做出更充分知情的预测,从而在相同有效参数数量下获得更好的微调结果。由于专家可以并行处理,MoLEx 引入的额外计算开销极小。我们在各种下游微调任务上实证证实了 MoLEx 与流行的 PEFT 基线方法结合时的优势,包括流行的 GLUE 基准以及端到端挑战。代码公开于 https://github.com/rachtsy/molex。

关键词

引用

@article{arxiv.2503.11144,
  title  = {MoLEx: Mixture of Layer Experts for Finetuning with Sparse Upcycling},
  author = {Rachel S. Y. Teo and Tan M. Nguyen},
  journal= {arXiv preprint arXiv:2503.11144},
  year   = {2025}
}