MoA:用于大型语言模型参数高效微调的异构适配器混合
计算与语言
2025-06-09 v1 人工智能
摘要
最近的研究将 Low-Rank Adaptation (LoRA) 和 Mixture-of-Experts (MoE) 集成,以进一步提升大型语言模型 (LLM) 应用中参数高效微调 (PEFT) 方法的性能。现有方法采用均质 MoE-LoRA 架构,由具有相似或相同结构和容量的 LoRA 专家组成。然而,这些方法常常出现表示坍缩和专家负载不平衡,严重影响 LLM 的潜在性能。为此,本文提出了一种称为 \textbf{混合适配器 (MoA)} 的异构方法。该方法动态整合具有多样化结构的 PEFT 适配器专家,利用其互补的表示能力以促进专家专业化,从而增强预训练知识向下游任务的有效迁移。MoA 支持两种变体:\textbf{(i)} \textit{软 MoA} 通过对所有专家输出进行加权融合实现细粒度集成;\textbf{(ii)} \textit{稀疏 MoA} 根据专家贡献稀疏激活适配器专家,性能几乎无显著下降。实验结果表明,异构 MoA 在性能和参数效率方面均优于均质 MoE-LoRA 方法。我们的项目已发布于 https://github.com/DCDmllm/MoA。
引用
@article{arxiv.2506.05927,
title = {LengClaro2023: A Dataset of Administrative Texts in Spanish with Plain Language adaptations},
author = {Belén Agüera-Marco and Itziar Gonzalez-Dios},
journal= {arXiv preprint arXiv:2506.05927},
year = {2025}
}
备注
In this report, we present a part of the master thesis written by Bel\'en Ag\"uera Marco in order to obtain the B.S. Language Analysis and Processing at the University of the Basque Country (UPV/EHU), supervised by Itziar Gonzalez-Dios