面向HPC基础设施的自动化动态AI推理扩缩放:集成Kubernetes、Slurm与vLLM
分布式、并行与集群计算
2025-11-27 v1 人工智能
数据库
性能
摘要
由于对人工智能(AI)推理需求的不断增长,尤其在高等教育领域,正在涌现出利用现有基础设施的新型解决方案。使用高性能计算(HPC)已成为实施此类解决方案的主流方法。然而,HPC的经典运营模式难以适应同步面向用户的动态AI应用工作负载的要求。本文提出我们的解决方案,通过集成vLLM、Slurm和Kubernetes于超级计算机\textit{RAMSES},为LLMs提供服务。初始基准测试表明,所提架构对100、500和1000个并发请求具有有效的扩展性,端到端延迟开销仅约为500毫秒。
关键词
引用
@article{arxiv.2511.21413,
title = {Automated Dynamic AI Inference Scaling on HPC-Infrastructure: Integrating Kubernetes, Slurm and vLLM},
author = {Tim Trappen and Robert Keßler and Roland Pabel and Viktor Achter and Stefan Wesner},
journal= {arXiv preprint arXiv:2511.21413},
year = {2025}
}
备注
6 pages, 3 figures