中文

tLoRA:高效多LoRA训练与弹性共享超模型

机器学习 2026-02-16 v2

摘要

随着低秩适应(LoRA)成为高效微调大型语言模型(LLM)的标准方法,共享集群正越来越多地在同一冻结骨干上并行执行大量LoRA训练任务。虽然近期进展使服务期间的多个适配器批处理(co-locating)成为可能,但LoRA适配器的高效训练时协同定位(training-time co-location)面临独特挑战。任务常在适配器秩、批量大小及资源分配方面存在差异,盲目批处理会引入同步停顿、通信开销及单任务性能下降,甚至优于独立执行。我们提出tLoRA,一个支持多个LoRA任务高效批处理的框架。tLoRA将共享相同基础模型的适配器融合为弹性共享超模型,利用现有分布式训练框架推导资源共享的并行计划。底层,tLoRA采用融合LoRA内核,自适应重构低秩计算瓦片并调度秩感知微批次,以最大化计算与通信之间的重叠。调度层,tLoRA集成在线、剩余容量感知调度器,自适应分组任务以最大化整体吞吐量。使用真实集群轨迹进行评估显示,tLoRA在训练吞吐量提升1.2--1.8倍,作业训练完成时间缩短2.3--5.4倍,GPU利用率提升37%。

关键词

引用

@article{arxiv.2602.07263,
  title  = {tLoRA: Efficient Multi-LoRA Training with Elastic Shared Super-Models},
  author = {Kevin Li and Dibyadeep Saha and Avni Kanodia and Fan Lai},
  journal= {arXiv preprint arXiv:2602.07263},
  year   = {2026}
}