基于朴素 LoRA 求和的高效模块化学习:利用正交性在高维模型中
机器学习
2025-08-19 v1 人工智能
摘要
大型语言模型的近期进步得益于规模扩大,而参数高效微调 (PEFT) 使仅更新少数参数成为可能。低秩适应 (LoRA) 将参数增量存储为两个小矩阵的乘积,这使得它们成为可组合的自然构建模块。受叠加原理的启发,我们假设在互不相交的领域中独立训练的 LoRA 模块大致正交,可通过简单相加进行组合。使用 LoRA 秩 4 和 alpha=64 对 GPT-2 Small (117M) 进行训练,为三个 QA 领域 (数学、医疗、金融) 训练适配器。在两两测试中,添加 Math+Medicine 适配器相对于合并数据微调可改进困惑度 -9.10%,而 Math+Finance 和 Finance+Medicine 分别变更为 +4.54% 和 +27.56%。在所有组合中,LoRA 增量之间的 RMS 余弦相似度与困惑度变化呈正相关且约为线性关系。朴素求和无需额外训练,仅需数秒即可实现,达到与在合并数据上训练的模型相当的性能,同时阐明了高阶组合中何时出现干扰。
引用
@article{arxiv.2508.11985,
title = {Efficient Modular Learning through Naive LoRA Summation: Leveraging Orthogonality in High-Dimensional Models},
author = {Zhanhao Cao and Clement Truong and Andrew Lizarraga},
journal= {arXiv preprint arXiv:2508.11985},
year = {2025}
}
备注
Preprint