中文

基于 SLURM 架构的可扩展引擎与不同大语言模型的性能

分布式、并行与集群计算 2025-08-26 v1 人工智能

摘要

本文详述了基于简单 Linux 资源管理工具 (SLURM) 的高性能计算 (HPC) 架构,用于在可扩展推理引擎中部署异构的大语言模型 (LLM)。文中利用动态资源调度和容器化微服务的无缝集成,高效管理多节点集群中的 CPU、GPU 和内存分配。通过使用 Llama 3.2 (1B 和 3B 参数) 和 Llama 3.1 (8B 和 70B) 进行大量实验,探讨了吞吐量、延迟和并发度,结果显示小模型可在亚 50 毫秒延迟下处理最高 128 个并发请求,而对于大型模型,仅需两个并发用户即可达到饱和,延迟超过 2 秒。该架构包含表示性状态转换应用程序编程接口 (REST API) 端点,用于单次和批量推理,以及诸如多步骤“仲裁”细化等高级工作流程。实验结果确认容器和调度活动的最小开销,表明该方法在批处理和交互式设置下均可可靠扩展。我们进一步展示了实际场景,包括部署带检索增强生成的聊天机器人,以证明该架构的灵活性和鲁棒性。所获结果为在大规模 HPC 基础设施上实现更高效、更具响应性和更具容错性的 LLM 推理奠定了基础。

关键词

引用

@article{arxiv.2508.17814,
  title  = {Scalable Engine and the Performance of Different LLM Models in a SLURM based HPC architecture},
  author = {Anderson de Lima Luiz and Shubham Vijay Kurlekar and Munir Georges},
  journal= {arXiv preprint arXiv:2508.17814},
  year   = {2025}
}

备注

Accepted in ESSV 2025 - https://www.essv.de/paper.php?id=1265