中文

S'MoRE:面向参数高效LLM微调的结构残差专家混合模型

数值分析 2025-04-11 v1 计算工程、金融与科学 数值分析

摘要

微调预训练大型语言模型(LLM)面临参数效率与模型容量的双重挑战。现有方法如低秩适配(LoRA)高效但缺乏灵活性,而混合专家(MoE)则提升了模型容量但会产生更多且 underutilization 参数。为解决这些限制,我们提出结构化残差专家混合模型(S'MoRE),一种新型框架无缝集成LoRA的效率与MoE的灵活性。概念上,S'MoRE采用专家权重的分层低秩分解,得到不同阶数的残差,在多层结构中相互连接。通过将输入 token 通过残差的子树进行路由,S'MoRE通过实例化和组装仅少量低秩矩阵来模拟大量专家的容量。我们将S'MoRE的残差在层间传播建模为一种特殊类型的图神经网络(GNN),并证明在类似参数预算下,S'MoRE通过指数级提高了传统MoE(或Mixture-of-LoRA)的结构灵活性。全面的理论分析和实证结果表明,S'MoRE实现了卓越的微调性能,为高效LLM适应提供了变革性方法。我们的实现地址:https://github.com/ZimpleX/SMoRE-LLM

关键词

引用

@article{arxiv.2504.06425,
  title  = {Neural Network Enhanced Polyconvexification of Isotropic Energy Densities in Computational Mechanics},
  author = {Loïc Balazi and Timo Neumeier and Malte A. Peter and Daniel Peterseim},
  journal= {arXiv preprint arXiv:2504.06425},
  year   = {2025}
}

备注

24 pages, 14 figures