LatencyPrism:面向 SLO 保障的 LLM 推理在线无侵入式延迟雕塑
分布式、并行与集群计算
2026-01-21 v2 机器学习
操作系统
摘要
LLM 推理延迟关键性地决定了用户体验与运营成本,直接影响 SLO 约束下的吞吐量。即使短暂的延迟尖峰也会在平均性能可接受时降低服务质量。然而,具有多样化软件框架和 XPU 架构的分布式推理环境结合动态工作负载,使延迟分析极具挑战性。受限于需要服务重启甚至暂停的侵入式设计,以及无法适应异构推理环境的硬件绑定实现,现有的 AI 性能剖析方法通常不足以进行实时生产分析。我们提出 LatencyPrism,首个零侵入多平台延迟雕塑系统。它旨在分解流水线上的推理延迟,主动预警推理延迟异常,并保障对 SLO 的遵循,所有这些均无需修改代码或重启服务。LatencyPrism 已在数千个 XPU 上部署超过六个月。它实现了批次级的低开销实时监控,并在毫秒级触发警报。该方法以 0.98 的 F1-score 区分由工作负载驱动的延迟变化与指示潜在问题的异常。我们还进行了广泛的实验和根因分析调查,以展示 LatencyPrism 的能力。此外,我们引入了首个 LLM 异常模拟工具包,以促进未来在鲁棒且可预测的推理系统方面的研究。
引用
@article{arxiv.2601.09258,
title = {LatencyPrism: Online Non-intrusive Latency Sculpting for SLO-Guaranteed LLM Inference},
author = {Yin Du and Jiayi Ren and Xiayu Sun and Tianyao Zhou and Haizhu Zhou and Ruiyan Ma and Danyang Zhang},
journal= {arXiv preprint arXiv:2601.09258},
year = {2026}
}
备注
13 pages, 6 figures