LoRAFusion:高效 LLMs 低秩适应微调
机器学习
2025-10-02 v1 人工智能
分布式、并行与集群计算
摘要
低秩适应 (LoRA) 已成为大型语言模型 (LLMs) 的领先参数高效微调 (PEFT) 方法,由于显著降低 GPU 内存占用,同时在下游任务上保持具竞争力的微调模型质量。尽管具有这些优势,我们识别到现有 LoRA 微调系统存在两个关键效率问题。首先,由于对大型激活张量进行冗余内存访问,导致运行时开销巨大。其次,未能在相同的 GPU 上并行微调多个共享相同基础模型的独立 LoRA 适配器,从而错失诸如减少流水线气泡、更好通信重叠以及改善 GPU 负载平衡等性能收益。为解决这些问题,我们提出了 LoRAFusion,一种用于 LLMs 的高效 LoRA 微调系统。在内核层面,LoRAFusion 提出一种图分解方法,以融合内存绑定操作。该设计消除不必要的内存访问,同时在不 incur 重计算或同步成本的情况下保留计算绑定 GEMM 的性能。在调度层面,LoRAFusion 引入一种用于多作业微调的自适应批量算法。它首先将 LoRA 适配器分为若干组,以有意在作业之间错开批量执行,然后在每组内求解装箱问题以生成平衡且依赖感知的 microbatch。LoRAFusion 相较于 Megatron-LM 实现了最高达 ( 平均) 的端到端加速,相较于 mLoRA(最新的多 LoRA 微调系统)实现了最高达 ( 平均) 的提升。我们的融合内核实现了最高达 ( 平均) 的内核性能提升,可直接作为现有 LoRA 系统中的即插即用替换方案。我们在 https://github.com/CentML/lorafusion 上开源 LoRAFusion。
引用
@article{arxiv.2510.00206,
title = {LoRAFusion: Efficient LoRA Fine-Tuning for LLMs},
author = {Zhanda Zhu and Qidong Su and Yaoyao Ding and Kevin Song and Shang Wang and Gennady Pekhimenko},
journal= {arXiv preprint arXiv:2510.00206},
year = {2025}
}
备注
Accepted by EuroSys 2026