中文

Argus:面向质量感知的高吞吐文本到图像推理服务系统

计算机视觉与模式识别 2025-11-11 v1 分布式、并行与集群计算

摘要

文本到图像(T2I)模型近年来获得了显著的流行。大多数这些模型都是扩散模型,具有独特的计算特征,区别于传统小规模机器学习模型和大语言模型。它们计算密集,采用迭代去噪过程生成图像,导致推理时间非常长。这在设计高吞吐系统方面造成了重大挑战。我们发现,大量提示可以借助更快的近似模型来服务。然而,近似设置必须为每个提示仔细校准,以避免质量下降。设计一个为每个提示分配合适模型并匹配相应近似设置的高吞吐系统仍是一个具有挑战性的问题。我们提出了Argus——一个高吞吐T2I推理系统,为每个提示选择合适的近似程度,在固定规模的集群上维持质量水平并满足吞吐目标。Argus智能地在不同的近似策略之间切换,以满足吞吐和质量要求。总体而言,Argus在两个真实工作负载轨迹上相较于基线实现了10倍更少的延迟服务级别目标(SLO)违规、10%的平均质量提升和40%的吞吐提升。

关键词

引用

@article{arxiv.2511.06724,
  title  = {Argus: Quality-Aware High-Throughput Text-to-Image Inference Serving System},
  author = {Shubham Agarwal and Subrata Mitra and Saud Iqbal},
  journal= {arXiv preprint arXiv:2511.06724},
  year   = {2025}
}

备注

Accepted at Middleware 2025