面向工作负载漂移的ASR服务时长感知调度
机器学习
2026-03-13 v1
摘要
大规模自动语音识别(ASR)服务管道中的调度策略在决定端到端(E2E)延迟方面发挥着关键作用。然而,广泛使用的服务引擎依赖于先来先服务(FCFS)调度,忽略了请求时长的差异,导致在工作负载漂移时出现队首阻塞。我们展示了音频时长是ASR模型(如 Whisper)中作业处理时间的准确代理,并利用这一洞察实现时长感知调度。我们将两种经典算法——最短作业优先(SJF)和最高响应比NEXT(HRRN)集成到 vLLM 中,在真实和漂移工作负载下进行评估。在 LibriSpeech test-clean 上的实验表明,与基线相比,SJF 在高负载下将中位数 E2E 延迟降低最高可达 ,但由于长请求的饿死, 百分位尾部延迟最高可提高 。HRRN 解决了这一权衡:它将中位数 E2E 延迟降低最高可达 ,同时将尾部延迟恶化控制在最高 。这些收益在工作负载漂移下保持不变,且无吞吐量惩罚,每个请求的调度开销 \,ms。
引用
@article{arxiv.2603.11273,
title = {Duration Aware Scheduling for ASR Serving Under Workload Drift},
author = {Darshan Makwana and Yash Jogi and Harsh Kotta and Aayush Kubba},
journal= {arXiv preprint arXiv:2603.11273},
year = {2026}
}