中文

压缩后服务:以极少开销服务数千个 LoRA 适配器

分布式、并行与集群计算 2025-06-02 v4 人工智能 计算与语言 机器学习

摘要

使用低秩适应 (LoRA) 对大语言模型 (LLM) 进行微调的做法日益流行,常常会产生大量相同的 LLM 副本,仅在其 LoRA 更新方面存在差异。这一范式为面向实时查询响应的系统带来挑战,因为每个查询都可能涉及不同的 LoRA。先前的工作虽针对此类系统进行优化设计,但仍需不断加载和卸载 LoRA,由于无法将数千个 LoRA 存储在 GPU 内存中。为缓解此问题,我们研究压缩在服务 LoRA 方面的效能。我们提出一种将 LoRA 联合压缩到共享基底并配以 LoRA-specific 比例矩阵的方法。我们将算法扩展到学习对联合压缩友好的 LoRA 聚类,从而使其能够平滑地扩展到大型 LoRA 集合。我们针对最高达 1000 个 LoRA 的实验结果表明,压缩后的 LoRA 能够保持性能优势,在拥有超过一千个 LoRA 的真实场景中显著提升吞吐量,同时仍保持约 80% 的单 LoRA 服务吞吐量。

关键词

引用

@article{arxiv.2407.00066,
  title  = {Compress then Serve: Serving Thousands of LoRA Adapters with Little Overhead},
  author = {Rickard Brüel-Gabrielsson and Jiacheng Zhu and Onkar Bhardwaj and Leshem Choshen and Kristjan Greenewald and Mikhail Yurochkin and Justin Solomon},
  journal= {arXiv preprint arXiv:2407.00066},
  year   = {2025}
}