中文

面向HPC基础设施的自动化动态AI推理扩缩放:集成Kubernetes、Slurm与vLLM

分布式、并行与集群计算 2025-11-27 v1 人工智能 数据库 性能

摘要

由于对人工智能(AI)推理需求的不断增长,尤其在高等教育领域,正在涌现出利用现有基础设施的新型解决方案。使用高性能计算(HPC)已成为实施此类解决方案的主流方法。然而,HPC的经典运营模式难以适应同步面向用户的动态AI应用工作负载的要求。本文提出我们的解决方案,通过集成vLLM、Slurm和Kubernetes于超级计算机\textit{RAMSES},为LLMs提供服务。初始基准测试表明,所提架构对100、500和1000个并发请求具有有效的扩展性,端到端延迟开销仅约为500毫秒。

关键词

引用

@article{arxiv.2511.21413,
  title  = {Automated Dynamic AI Inference Scaling on HPC-Infrastructure: Integrating Kubernetes, Slurm and vLLM},
  author = {Tim Trappen and Robert Keßler and Roland Pabel and Viktor Achter and Stefan Wesner},
  journal= {arXiv preprint arXiv:2511.21413},
  year   = {2025}
}

备注

6 pages, 3 figures