面向精调基础模型的更强低秩专家混合模型
机器学习
2025-02-25 v1 人工智能
摘要
为了简化基础模型的精调,低秩适配器 (LoRA) 已在各类领域得到广泛采用,包括指令调优和领域适应。LoRA 的核心思想是将一个满秩矩阵分解为两个低秩矩阵的乘积,从而减少存储消耗并加速训练过程。此外,为解决 LoRA 的表达能力有限问题,已引入 Mixture-of-Expert (MoE) 以整合多个 LoRA 适配器。LoRA 专家的集成在多个下游场景中显现出可见的性能提升。然而,LoRA 的混合模型 (MoE-LoRA) 在调优和推理期间仍表现出较低的鲁棒性。灵感来自采用黎曼预条件器将 LoRA 训练为子空间投影器的做法,我们提出了一种新的 MoE-LoRA 训练策略,通过多空间投影来稳定和提升其特征学习过程。在 SGD 和 AdamW 优化器上的实验表明,我们的方法有效。源代码可在 https://github.com/THUDM/MoELoRA_Riemannian 查阅。
引用
@article{arxiv.2502.15828,
title = {A Stronger Mixture of Low-Rank Experts for Fine-Tuning Foundation Models},
author = {Mengyang Sun and Yihao Wang and Tao Feng and Dan Zhang and Yifan Zhu and Jie Tang},
journal= {arXiv preprint arXiv:2502.15828},
year = {2025}
}