SCOOT:面向 LLM 推理引擎的 SLO 导向性能调优
分布式、并行与集群计算
2025-02-21 v2
摘要
随着大语言模型 (LLM) 在广泛的 web 应用中获得越来越多的关注, 优化 LLM 推理服务的服务水平目标 (SLO) 对于提升用户满意度和提高云厂商竞争力至关重要。本文我们观察到, 通过调整 LLM 推理引擎的参数可以提高服务性能, 而不同服务的最优参数配置也不同。因此, 我们提出了 SCOOT, 一个用于通过调节推理引擎参数来优化每个 LLM 推理服务 SLO 的自动性能调优系统。SCOOT 联合利用单目标和多目标贝叶斯优化 (BO) 技术通过探索和开发处理各种优化目标。此外, SCOOT 通过已知约束修剪搜索空间, 并采用随机森林在调优过程中学习隐藏约束以缓解无效探索。为提高调优效率, SCOOT 利用并行建议加速调优过程。广泛的实验表明, SCOOT 在 SLO 优化方面显著优于现有调优技术, 同时大幅提高调优效率。此外, SCOOT 对各种 LLM 推理引擎包括 vLLM 和 TensorRT-LLM 都具有通用性。目前, SCOOT 已经在蚂蚁集团的生产环境中实现。
引用
@article{arxiv.2408.04323,
title = {SCOOT: SLO-Oriented Performance Tuning for LLM Inference Engines},
author = {Ke Cheng and Zhi Wang and Wen Hu and Tiannuo Yang and Jianguo Li and Sheng Zhang},
journal= {arXiv preprint arXiv:2408.04323},
year = {2025}
}
备注
Accepted by The ACM Web Conference 2025 (WWW'25)