中文

可扩展AI推理:AI模型服务的性能分析与优化

机器学习 2026-04-23 v1 人工智能

摘要

AI研究通常强调模型设计和算法性能,而部署和推理尽管对实际应用至关重要,却相对未被充分探索。本研究通过与graphworks.ai合作开发的基于BentoML的AI推理系统进行性能与优化研究,以填补这一空白。评估首先在三种现实工作负载场景下建立基线性能。为确保公平且可复现的评估,整个实验过程使用预训练的RoBERTa情感分析模型。系统承受遵循伽马分布和指数分布的流量模式,以模拟真实世界的使用条件,包括稳定、突发和高强度工作负载。收集并分析关键性能指标,如延迟百分位数和吞吐量,以识别推理管道中的瓶颈。基于基线结果,在服务栈的多个层面引入优化策略以提高效率和可扩展性。然后在相同工作负载条件下重新评估优化后的系统,并使用统计分析将结果与基线进行比较,以量化所应用改进的影响。研究结果展示了使用BentoML实现高效且可扩展AI推理的实用策略。本研究考察了延迟和吞吐量在不同工作负载下的扩展方式,运行时、服务和部署层面的优化如何影响响应时间,以及单节点K3s集群中的部署如何影响中断期间的弹性。

引用

@article{arxiv.2604.20420,
  title  = {Scalable AI Inference: Performance Analysis and Optimization of AI Model Serving},
  author = {Hung Cuong Pham and Fatih Gedikli},
  journal= {arXiv preprint arXiv:2604.20420},
  year   = {2026}
}