中文

Punica:多租户 LoRA 服务系统

分布式、并行与集群计算 2023-10-31 v1 机器学习

摘要

低秩适应(LoRA)已成为一种重要且流行的将预训练模型适配到特定领域的方法。我们提出 Punica,一种在共享 GPU 集群中服务多个 LoRA 模型的系统。Punica 包含一种新的 CUDA 内核设计,允许对不同 LoRA 模型的 GPU 操作进行批处理。这使得 GPU 在服务多个不同 LoRA 模型时仅需保留一份底层预训练模型的副本,从而在内存与计算两方面显著提升 GPU 效率。我们的调度器在共享 GPU 集群中整合多租户 LoRA 服务负载。在固定规模的 GPU 集群下,评估显示 Punica 在服务多个 LoRA 模型时相较最先进的 LLM 服务系统实现了 12 倍的更高吞吐,而每词元仅增加 2ms 延迟。Punica 已在 https://github.com/punica-ai/punica 开源。

关键词

引用

@article{arxiv.2310.18547,
  title  = {Punica: Multi-Tenant LoRA Serving},
  author = {Lequn Chen and Zihao Ye and Yongji Wu and Danyang Zhuo and Luis Ceze and Arvind Krishnamurthy},
  journal= {arXiv preprint arXiv:2310.18547},
  year   = {2023}
}