中文

Harli:面向SLO的LLM推理与PEFT微调的协同部署

分布式、并行与集群计算 2025-11-20 v2 机器学习

摘要

大型语言模型(LLM)正越来越多地在模型即服务(MaaS)范式下进行部署。为满足严格的服务质量(QoS)要求,现有的LLM serving系统会将推理的填充阶段和解码阶段进行 disaggregation。然而,解码实例常常因其内存受限的特性以及动态工作负载下的批处理不足而导致GPU利用率较低,资源未得到充分利用。我们引入Harli,通过在LLM解码实例上联合部署参数高效微调(PEFT)任务来提高GPU利用率。PEFT任务计算受限且内存效率高,是安全协同部署的理想候选。具体而言,Harli通过三个组件来解决关键挑战——内存受限和不可预测的干扰:统一内存分配器实现运行时内存复用、两阶段延迟预测器用于解码延迟建模,以及确保QoS保证的吞吐量最大化调度器。实验结果表明,Harli在保持严格的解码推理QoS保证的前提下,将微调吞吐量提高了平均46.2%(最高达92.0%),显著优于现有最先进的serving系统。

关键词

引用

@article{arxiv.2511.11729,
  title  = {Harli: SLO-Aware Co-location of LLM Inference and PEFT-based Finetuning on Model-as-a-Service Platforms},
  author = {Ao Xu and Han Zhao and Weihao Cui and Quan Chen and Yukang Chen and Shulai Zhang and Shuang Chen and Jiemin Jiang and Zhibin Yu and Minyi Guo},
  journal= {arXiv preprint arXiv:2511.11729},
  year   = {2025}
}