Block-Diagonal LoRA:消除张量并行 LoRA 服务通信开销
机器学习
2026-01-07 v2
摘要
在同时服务单个基础 LLM 多个不同 LoRA 适配器时,这些适配器不能简单地与基础模型权重合并,因为适配器交换会产生开销,而使用不同适配器的请求无法进行批处理。相反,LoRA 计算必须与基础 LLM 计算分离,在多设备设置中,LoRA 适配器可以以与基础模型张量并行执行方式一致的方式进行分片,如 S-LoRA 所提议。然而,S-LoRA 的分片策略会遇到一些通信开销,虽然在理论上可能较小,但在实际操作中可能较大。本文提出将某些 LoRA 因子限制为 block-diagonal,从而实现一种无需为 LoRA 计算额外通信的分片方式。我们在大量实验中演示了 block-diagonal LoRA 方法在参数效率方面与标准 LoRA 相当(即在相同参数数量下实现相似的下游性能),并且在 S-LoRA 上实现了显著的端到端加速。例如,在八个 A100 GPU 上,我们观察到 Llama-3.1-70B 时,端到端加速最高达 1.79 倍(1.23 倍),适配器参数数量为 0.87 倍(1.74 倍);对于 Llama-3.1-8B,端到端加速最高达 1.63 倍(1.3 倍),适配器参数数量为 0.86 倍(1.73 倍)。
引用
@article{arxiv.2510.23346,
title = {Block-Diagonal LoRA for Eliminating Communication Overhead in Tensor Parallel LoRA Serving},
author = {Xinyu Wang and Jonas M. Kübler and Kailash Budhathoki and Yida Wang and Matthäus Kleindessner},
journal= {arXiv preprint arXiv:2510.23346},
year = {2026}
}