二优于一:旋转扩展 LoRA
机器学习
2025-05-30 v1 软件工程
摘要
扩展基于低秩适应(LoRA)的混合专家(MoE)有助于大语言模型(LLM)高效适应多样化任务。然而,将输入路由到最佳专家的传统门控机制可能在根本上阻碍 LLM 的可扩展性,导致泛化能力差和欠拟合问题。我们发现其根本原因在于现有加权和机制在 LoRA 表示的凸锥内外均具有受限的表达能力。这促使我们提出 RadarGate,一种新颖的几何启发式门控方法,通过引入 LoRA 表示的旋转操作来提升表达能力,并促进多个 LoRA 之间更丰富的特征交互,以实现可扩展的 LLM。具体而言,我们首先使用可学习组件将每个 LoRA 表示与其他 LoRA 融合,然后将输出送入旋转矩阵。该矩阵包含定义 LoRA 表示间相对角度关系的可学习参数。这种简单而有效的机制提供了额外的自由度,有助于学习跨 LoRA 的协同作用,并在 LoRA 数量增加时妥善应对泛化能力差和欠拟合的挑战。在 6 个公共基准的 21 项任务上的大量实验表明了 RadarGate 在扩展 LoRA 方面的有效性。我们还提供了有价值的见解,揭示了对每对表示的旋转具有对比性,在几何变换过程中鼓励语义相似的表示更紧密地对齐,同时将距离较远的表示进一步推开。我们将向社区发布代码。
引用
@article{arxiv.2505.23184,
title = {Two Is Better Than One: Rotations Scale LoRAs},
author = {Hongcan Guo and Guoshun Nan and Yuan Yang and Diyang Zhang and Haotian Li and Zhican Chen and Qinchuan Zhou and Yuhan Ran and Xinye Cao and Sicong Leng and Xiaofeng Tao and Xudong Jiang},
journal= {arXiv preprint arXiv:2505.23184},
year = {2025}
}
备注
27pages, 16figures