中文

Apparate:重新思考提前退出以缓解机器学习服务中的延迟-吞吐量矛盾

分布式、并行与集群计算 2024-09-25 v2 机器学习

摘要

机器学习(ML)推理平台肩负着平衡两个相互竞争目标的重任:在大量请求下确保高吞吐量,以及提供低延迟响应以支持交互式应用。遗憾的是,现有的平台调节手段(如批大小)无法缓解这一根本矛盾,反而只能让用户在两者之间作出生硬的权衡。本文通过改变执行推理的粒度,探索了一种缓解吞吐量-延迟权衡的替代策略。我们提出了 Apparate,这是一个在 ML 模型中自动应用并管理提前退出(EEs)的系统,使得特定输入可在中间层输出结果。为应对 EEs 带来的时变开销与准确性挑战,Apparate 重新利用退出点提供持续反馈,从而驱动若干新颖的运行时监控与自适应策略。在不影响吞吐量且不违反严格准确性约束的前提下,Apparate 针对多样化的 CV 和 NLP 分类工作负载将中位响应延迟降低了 40.5%--91.5% 和 10.0%--24.2%,并针对生成式场景将每 token 中位延迟降低了 22.6%--77.9%。

关键词

引用

@article{arxiv.2312.05385,
  title  = {Apparate: Rethinking Early Exits to Tame Latency-Throughput Tensions in ML Serving},
  author = {Yinwei Dai and Rui Pan and Anand Iyer and Kai Li and Ravi Netravali},
  journal= {arXiv preprint arXiv:2312.05385},
  year   = {2024}
}

备注

The first two authors contributed equally and are listed in alphabetical order. The paper has been accepted by SOSP '24