SLO-Guard:面向 SLO 约束 LLM 推理的崩溃感知、预算一致的自动调优
摘要
在延迟服务水平目标(SLO)下服务大语言模型是一种配置密集型系统问题,其搜索空间异常脆弱:许多可行配置会直接崩溃或未能满足用户可见的延迟目标,而标准黑盒优化器将这些失败视为浪费的试验。我们提出 SLO-Guard,一个崩溃感知的 vLLM 推理自动调优器,将崩溃视为一等观察对象。SLO-Guard 组合可行性优先的热力预算退火(Thermal Budget Annealing, TBA)探索阶段与温暖启动的树结构 Parzen 估计器(Tree-structured Parzen Estimator, TPE)利用阶段;handoff 阶段会回放所有探索历史,包括以极端约束违规编码的崩溃。我们 additionally 贡献了一个配置修复步骤、GPU 感知的 KV-cache 内存警卫,以及四类崩溃分类。我们在 Qwen2-1.5B 模型上使用 vLLM 0.19 在 NVIDIA A100 40GB 上评估 SLO-Guard。在一个预设的五随机种子研究中,SLO-Guard 和均匀随机搜索在纠正后的并发 harness 下均实现 75/75 的可行性,零崩溃;在最佳延迟上两者在 Mann-Whitney 双侧 p=0.84 时统计上无显著差异。SLO-Guard 的优势在于预算一致性:在快速服务 regime 中,SLO-Guard 的试验次数显著高于随机搜索(10.20 vs. 7.40/15;单侧 p=0.014),handoff 后的后续一致性也更高(0.876 vs. 0.539;p=0.010)。在并发负载下,SLO-Guard 的跨随机种子标准差在最佳延迟上是随机搜索的 4.4 倍(2.26 ms vs. 10.00 ms)。一个 harness 复制分析表明,一致性发现在独立的顺序调度测量条件下仍然成立。我们的核心主张并非 SLO-Guard 找到更好的最终配置,而是它在找到快速服务 regime 后更可预测地消耗固定的调优预算。
引用
@article{arxiv.2604.17627,
title = {SLO-Guard: Crash-Aware, Budget-Consistent Autotuning for SLO-Constrained LLM Serving},
author = {Christian Lysenstøen},
journal= {arXiv preprint arXiv:2604.17627},
year = {2026}
}
备注
20 pages, 6 figures, 5 tables. Code and raw per-trial JSONL data: https://github.com/Chrislysen/SLO-Guard