面向云基AI推理服务的可扩展性优化:实时负载均衡与自动扩缩容的策略
分布式、并行与集群计算
2025-04-23 v1 人工智能
摘要
AI推理服务在云端的快速扩张 necessitates 一种 robust 可扩展性解决方案来管理动态工作负载并保持高性能。本研究提出了一个针对云AI推理服务的综合可扩展性优化框架, focus on 实时负载均衡和自动扩缩容策略。该提出的模型是一种混合方法,结合了用于自适应负载分配的强化学习和用于精确需求预测的深度神经网络。这种多层次方法使系统能够预见工作负载波动,主动调整资源,以确保最大资源利用率并最小化延迟。此外,该模型中集成的分散式决策过程旨在增强容错性并减少扩缩操作的响应时间。实验结果表明,所提出的模型将负载均衡效率提高35%,将响应延迟降低28%,因此相对于传统可扩展性解决方案显示出显著的优化效果。
引用
@article{arxiv.2504.15296,
title = {Scalability Optimization in Cloud-Based AI Inference Services: Strategies for Real-Time Load Balancing and Automated Scaling},
author = {Yihong Jin and Ze Yang},
journal= {arXiv preprint arXiv:2504.15296},
year = {2025}
}
备注
Accepted to BDICN 2025