中文

面向工作负载漂移的ASR服务时长感知调度

机器学习 2026-03-13 v1

摘要

大规模自动语音识别(ASR)服务管道中的调度策略在决定端到端(E2E)延迟方面发挥着关键作用。然而,广泛使用的服务引擎依赖于先来先服务(FCFS)调度,忽略了请求时长的差异,导致在工作负载漂移时出现队首阻塞。我们展示了音频时长是ASR模型(如 Whisper)中作业处理时间的准确代理,并利用这一洞察实现时长感知调度。我们将两种经典算法——最短作业优先(SJF)和最高响应比NEXT(HRRN)集成到 vLLM 中,在真实和漂移工作负载下进行评估。在 LibriSpeech test-clean 上的实验表明,与基线相比,SJF 在高负载下将中位数 E2E 延迟降低最高可达 73%73\%,但由于长请求的饿死,9090 百分位尾部延迟最高可提高 97%97\%。HRRN 解决了这一权衡:它将中位数 E2E 延迟降低最高可达 28%28\%,同时将尾部延迟恶化控制在最高 24%24\%。这些收益在工作负载漂移下保持不变,且无吞吐量惩罚,每个请求的调度开销 <0.1<0.1\,ms。

关键词

引用

@article{arxiv.2603.11273,
  title  = {Duration Aware Scheduling for ASR Serving Under Workload Drift},
  author = {Darshan Makwana and Yash Jogi and Harsh Kotta and Aayush Kubba},
  journal= {arXiv preprint arXiv:2603.11273},
  year   = {2026}
}