中文

ALTO:自适应LoRA调谐与异构LoRA训练工作负载的编排

机器学习 2026-04-13 v2 人工智能 分布式、并行与集群计算

摘要

低秩适应(LoRA)是目前用于大型语言模型参数高效微调的主导方法,但要实现高质量的adapter,往往需要系统性的超参数调谋,因为LoRA性能对配置选择高度敏感。在实践中,这导致许多并发的LoRA作业,常常跨越多租户环境中的异构任务。现有系统大多独立处理这些作业,既浪费了对弱候选者的计算资源,又导致GPU利用率不足。我们提出ALTO(自适应LoRA调谋与编排),一个协同设计的训练系统,用于加速LoRA超参数调谋,并实现跨异构任务的高效集群共享。ALTO的核心洞见在于,当多个调谋作业并发运行于共享冻结backbone上时,会暴露出单作业设计无法利用的优化机会。基于此,ALTO监控损失轨迹,以及时终止不具前景的配置,利用融合的分组GEMM以及一种新的基于排位的adapter并行性,共存存活的adapter并回收释放的GPU资源,同时结合任务内外调度,以利用LoRA作业可预测的持续时间,提高多任务放置效率。广泛的评估显示,ALTO在不牺牲adapter质量的前提下,实现了最新技术的最高可达 13.8×13.8\times 的加速。

关键词

引用

@article{arxiv.2604.05426,
  title  = {ALTO: Adaptive LoRA Tuning and Orchestration for Heterogeneous LoRA Training Workloads},
  author = {Jingwei Zuo and Xinze Feng and Zien Liu and Kaijian Wang and Fanjiang Ye and Ye Cao and Zhuang Wang and Yuke Wang},
  journal= {arXiv preprint arXiv:2604.05426},
  year   = {2026}
}