中文

IPA:实现高精度与高成本效益的推理流水线自适应

分布式、并行与集群计算 2024-05-28 v3 机器学习 性能

摘要

鉴于严格的端到端延迟要求,高效优化多模型推理流水线以实现快速、准确且具成本效益的推理是机器学习生产系统中的一个关键挑战。为简化对推理流水线中延迟、准确率和成本这一庞大而复杂权衡空间的探索,提供商常选择仅考虑其中之一。然而,挑战在于如何调和延迟、准确率和成本的权衡。为解决该挑战并提出高效管理推理流水线中模型变体的方案,我们提出 IPA,一种在线深度学习推理流水线自适应系统,其高效利用各深度学习任务的模型变体。模型变体是同一深度学习任务下预训练模型的不同版本,在资源需求、延迟和准确率上存在差异。IPA 通过整数规划动态配置批大小、副本数和模型变体,以优化准确率、最小化成本并满足用户定义的延迟服务等级协议 (SLAs)。它支持多目标设置,以在准确率和成本目标间实现不同权衡,同时适应变化的工作负载与动态流量模式。相较现有方法,探索更广泛的配置使 IPA 能在成本与准确率目标间取得更好的权衡。在 Kubernetes 上以五条真实推理流水线进行的广泛实验表明,IPA 以极小的成本增长将端到端准确率提升了高达 21%。用于复现的代码与数据可在 https://github.com/reconfigurable-ml-pipeline/ipa 获取。

关键词

引用

@article{arxiv.2308.12871,
  title  = {IPA: Inference Pipeline Adaptation to Achieve High Accuracy and Cost-Efficiency},
  author = {Saeid Ghafouri and Kamran Razavi and Mehran Salmani and Alireza Sanaee and Tania Lorido-Botran and Lin Wang and Joseph Doyle and Pooyan Jamshidi},
  journal= {arXiv preprint arXiv:2308.12871},
  year   = {2024}
}