中文

LoRAFusion:高效 LLMs 低秩适应微调

机器学习 2025-10-02 v1 人工智能 分布式、并行与集群计算

摘要

低秩适应 (LoRA) 已成为大型语言模型 (LLMs) 的领先参数高效微调 (PEFT) 方法,由于显著降低 GPU 内存占用,同时在下游任务上保持具竞争力的微调模型质量。尽管具有这些优势,我们识别到现有 LoRA 微调系统存在两个关键效率问题。首先,由于对大型激活张量进行冗余内存访问,导致运行时开销巨大。其次,未能在相同的 GPU 上并行微调多个共享相同基础模型的独立 LoRA 适配器,从而错失诸如减少流水线气泡、更好通信重叠以及改善 GPU 负载平衡等性能收益。为解决这些问题,我们提出了 LoRAFusion,一种用于 LLMs 的高效 LoRA 微调系统。在内核层面,LoRAFusion 提出一种图分解方法,以融合内存绑定操作。该设计消除不必要的内存访问,同时在不 incur 重计算或同步成本的情况下保留计算绑定 GEMM 的性能。在调度层面,LoRAFusion 引入一种用于多作业微调的自适应批量算法。它首先将 LoRA 适配器分为若干组,以有意在作业之间错开批量执行,然后在每组内求解装箱问题以生成平衡且依赖感知的 microbatch。LoRAFusion 相较于 Megatron-LM 实现了最高达 1.96×1.96\times (1.47×1.47\times 平均) 的端到端加速,相较于 mLoRA(最新的多 LoRA 微调系统)实现了最高达 1.46×1.46\times (1.29×1.29\times 平均) 的提升。我们的融合内核实现了最高达 1.39×1.39\times (1.27×1.27\times 平均) 的内核性能提升,可直接作为现有 LoRA 系统中的即插即用替换方案。我们在 https://github.com/CentML/lorafusion 上开源 LoRAFusion。

关键词

引用

@article{arxiv.2510.00206,
  title  = {LoRAFusion: Efficient LoRA Fine-Tuning for LLMs},
  author = {Zhanda Zhu and Qidong Su and Yaoyao Ding and Kevin Song and Shang Wang and Gennady Pekhimenko},
  journal= {arXiv preprint arXiv:2510.00206},
  year   = {2025}
}

备注

Accepted by EuroSys 2026