OMoE:通过正交微调多样化低秩适应混合专家
机器学习
2025-07-22 v2 计算与语言
摘要
构建针对低秩适应(LoRA)的混合专家(Mixture of Experts,MoE)架构正成为参数高效微调(PEFT)中一个潜在方向,因其模块化设计和卓越性能。然而,仅仅堆叠专家的数量并不能保证显著的性能提升。本文首先进行定性分析,表明在基础 MoE 中,专家会退化为相似的表征,从而限制了模块化设计和计算效率的潜力。随后,我们的分析揭示,先前的 MoE 变体的性能可能受限于专家之间缺乏多样性。针对这些发现, 我们提出正交混合专家(Orthogonal Mixture-of-Experts,OMoE),这是一种资源高效的 MoE 变体,通过正交训练专家来促进多样性。在 OMoE 中,采用 Gram-Schmidt 过程以确保专家的表征位于 Stiefel 流形内。通过直接应用于架构, OMoE 保持学习目标不变,且无需牺牲最优性。该方法简单且缓解了内存瓶颈,因为它所需的专家数量远少于基础 MoE 模型。实验在多样化的常识推理基准上表明, OMoE 能持续实现稳定且高效的性能提升,相较于最先进的方法显著减少了所需专家的数量。
引用
@article{arxiv.2501.10062,
title = {OMoE: Diversifying Mixture of Low-Rank Adaptation by Orthogonal Finetuning},
author = {Jinyuan Feng and Zhiqiang Pu and Tianyi Hu and Dongmin Li and Xiaolin Ai and Huimu Wang},
journal= {arXiv preprint arXiv:2501.10062},
year = {2025}
}
备注
This paper is accepted by ECAI 2025